91欧美超碰AV自拍|国产成年人性爱视频免费看|亚洲 日韩 欧美一厂二区入|人人看人人爽人人操aV|丝袜美腿视频一区二区在线看|人人操人人爽人人爱|婷婷五月天超碰|97色色欧美亚州A√|另类A√无码精品一级av|欧美特级日韩特级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

分析協(xié)議層注冊(cè)進(jìn)內(nèi)核以及被socket的過(guò)程

B4Pb_gh_6fde77c ? 來(lái)源:Linux內(nèi)核之旅 ? 作者:陳莉君 ? 2021-08-04 16:13 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

1. 前言

本文首先從宏觀上概述了數(shù)據(jù)包發(fā)送的流程,接著分析了協(xié)議層注冊(cè)進(jìn)內(nèi)核以及被socket的過(guò)程,最后介紹了通過(guò) socket 發(fā)送網(wǎng)絡(luò)數(shù)據(jù)的過(guò)程。

2. 數(shù)據(jù)包發(fā)送宏觀視角

從宏觀上看,一個(gè)數(shù)據(jù)包從用戶程序到達(dá)硬件網(wǎng)卡的整個(gè)過(guò)程如下:

使用系統(tǒng)調(diào)用(如 sendto,sendmsg 等)寫數(shù)據(jù)

數(shù)據(jù)穿過(guò)socket 子系統(tǒng),進(jìn)入socket 協(xié)議族(protocol family)系統(tǒng)

協(xié)議族處理:數(shù)據(jù)穿過(guò)協(xié)議層,這一過(guò)程(在許多情況下)會(huì)將數(shù)據(jù)(data)轉(zhuǎn)換成數(shù)據(jù)包(packet)

數(shù)據(jù)穿過(guò)路由層,這會(huì)涉及路由緩存和 ARP 緩存的更新;如果目的 MAC 不在 ARP 緩存表中,將觸發(fā)一次 ARP 廣播來(lái)查找 MAC 地址

穿過(guò)協(xié)議層,packet 到達(dá)設(shè)備無(wú)關(guān)層(device agnostic layer)

使用 XPS(如果啟用)或散列函數(shù)選擇發(fā)送隊(duì)列

調(diào)用網(wǎng)卡驅(qū)動(dòng)的發(fā)送函數(shù)

數(shù)據(jù)傳送到網(wǎng)卡的 qdisc(queue discipline,排隊(duì)規(guī)則)

qdisc 會(huì)直接發(fā)送數(shù)據(jù)(如果可以),或者將其放到隊(duì)列,下次觸發(fā)NET_TX 類型軟中斷(softirq)的時(shí)候再發(fā)送

數(shù)據(jù)從 qdisc 傳送給驅(qū)動(dòng)程序

驅(qū)動(dòng)程序創(chuàng)建所需的DMA 映射,以便網(wǎng)卡從 RAM 讀取數(shù)據(jù)

驅(qū)動(dòng)向網(wǎng)卡發(fā)送信號(hào),通知數(shù)據(jù)可以發(fā)送了

網(wǎng)卡從 RAM 中獲取數(shù)據(jù)并發(fā)送

發(fā)送完成后,設(shè)備觸發(fā)一個(gè)硬中斷(IRQ),表示發(fā)送完成

硬中斷處理函數(shù)被喚醒執(zhí)行。對(duì)許多設(shè)備來(lái)說(shuō),這會(huì)觸發(fā) NET_RX 類型的軟中斷,然后 NAPI poll 循環(huán)開始收包

poll 函數(shù)會(huì)調(diào)用驅(qū)動(dòng)程序的相應(yīng)函數(shù),解除 DMA 映射,釋放數(shù)據(jù)

3. 協(xié)議層注冊(cè)

協(xié)議層分析我們將關(guān)注 IP 和 UDP 層,其他協(xié)議層可參考這個(gè)過(guò)程。我們首先來(lái)看協(xié)議族是如何注冊(cè)到內(nèi)核,并被 socket 子系統(tǒng)使用的。

當(dāng)用戶程序像下面這樣創(chuàng)建 UDP socket 時(shí)會(huì)發(fā)生什么?

sock = socket(AF_INET, SOCK_DGRAM, IPPROTO_UDP)

簡(jiǎn)單來(lái)說(shuō),內(nèi)核會(huì)去查找由 UDP 協(xié)議棧導(dǎo)出的一組函數(shù)(其中包括用于發(fā)送和接收網(wǎng)絡(luò)數(shù)據(jù)的函數(shù)),并賦給 socket 的相應(yīng)字段。準(zhǔn)確理解這個(gè)過(guò)程需要查看 AF_INET 地址族的代碼。

內(nèi)核初始化的很早階段就執(zhí)行了 inet_init 函數(shù),這個(gè)函數(shù)會(huì)注冊(cè) AF_INET 協(xié)議族 ,以及該協(xié)議族內(nèi)的各協(xié)議棧(TCP,UDP,ICMP 和 RAW),并調(diào)用初始化函數(shù)使協(xié)議棧準(zhǔn)備好處理網(wǎng)絡(luò)數(shù)據(jù)。inet_init 定義在net/ipv4/af_inet.c 。

AF_INET 協(xié)議族導(dǎo)出一個(gè)包含 create 方法的 struct net_proto_family 類型實(shí)例。當(dāng)從用戶程序創(chuàng)建 socket 時(shí),內(nèi)核會(huì)調(diào)用此方法:

static const struct net_proto_family inet_family_ops = {

.family = PF_INET,

.create = inet_create,

.owner = THIS_MODULE,

};

inet_create 根據(jù)傳遞的 socket 參數(shù),在已注冊(cè)的協(xié)議中查找對(duì)應(yīng)的協(xié)議:

/* Look for the requested type/protocol pair. */

lookup_protocol:

err = -ESOCKTNOSUPPORT;

rcu_read_lock();

list_for_each_entry_rcu(answer, &inetsw[sock-》type], list) {

err = 0;

/* Check the non-wild match. */

if (protocol == answer-》protocol) {

if (protocol != IPPROTO_IP)

break;

} else {

/* Check for the two wild cases. */

if (IPPROTO_IP == protocol) {

protocol = answer-》protocol;

break;

}

if (IPPROTO_IP == answer-》protocol)

break;

}

err = -EPROTONOSUPPORT;

}

然后,將該協(xié)議的回調(diào)方法(集合)賦給這個(gè)新創(chuàng)建的 socket:

sock-》ops = answer-》ops;

可以在 af_inet.c 中看到所有協(xié)議的初始化參數(shù)。下面是TCP 和 UDP的初始化參數(shù):

/* Upon startup we insert all the elements in inetsw_array[] into

* the linked list inetsw.

*/

static struct inet_protosw inetsw_array[] =

{

{

.type = SOCK_STREAM,

.protocol = IPPROTO_TCP,

.prot = &tcp_prot,

.ops = &inet_stream_ops,

.no_check = 0,

.flags = INET_PROTOSW_PERMANENT |

INET_PROTOSW_ICSK,

},

{

.type = SOCK_DGRAM,

.protocol = IPPROTO_UDP,

.prot = &udp_prot,

.ops = &inet_dgram_ops,

.no_check = UDP_CSUM_DEFAULT,

.flags = INET_PROTOSW_PERMANENT,

},

/* 。。。。 more protocols 。。。 */

IPPROTO_UDP 協(xié)議類型有一個(gè) ops 變量,包含很多信息,包括用于發(fā)送和接收數(shù)據(jù)的回調(diào)函數(shù):

const struct proto_ops inet_dgram_ops = {

.family = PF_INET,

.owner = THIS_MODULE,

/* 。。。 */

.sendmsg = inet_sendmsg,

.recvmsg = inet_recvmsg,

/* 。。。 */

};

EXPORT_SYMBOL(inet_dgram_ops);

prot 字段指向一個(gè)協(xié)議相關(guān)的變量(的地址),對(duì)于 UDP 協(xié)議,其中包含了 UDP 相關(guān)的回調(diào)函數(shù)。UDP 協(xié)議對(duì)應(yīng)的 prot 變量為 udp_prot,定義在 net/ipv4/udp.c:

struct proto udp_prot = {

.name = “UDP”,

.owner = THIS_MODULE,

/* 。。。 */

.sendmsg = udp_sendmsg,

.recvmsg = udp_recvmsg,

/* 。。。 */

};

EXPORT_SYMBOL(udp_prot);

現(xiàn)在,讓我們轉(zhuǎn)向發(fā)送 UDP 數(shù)據(jù)的用戶程序,看看 udp_sendmsg 是如何在內(nèi)核中被調(diào)用的。

4. 通過(guò) socket 發(fā)送網(wǎng)絡(luò)數(shù)據(jù)

用戶程序想發(fā)送 UDP 網(wǎng)絡(luò)數(shù)據(jù),因此它使用 sendto 系統(tǒng)調(diào)用:

ret = sendto(socket, buffer, buflen, 0, &dest, sizeof(dest));

該系統(tǒng)調(diào)用穿過(guò)Linux 系統(tǒng)調(diào)用(system call)層,最后到達(dá)net/socket.c中的這個(gè)函數(shù):

/*

* Send a datagram to a given address. We move the address into kernel

* space and check the user space data area is readable before invoking

* the protocol.

*/

SYSCALL_DEFINE6(sendto, int, fd, void __user *, buff, size_t, len,

unsigned int, flags, struct sockaddr __user *, addr,

int, addr_len)

{

/* 。。。 code 。。。 */

err = sock_sendmsg(sock, &msg, len);

/* 。。。 code 。。。 */

}

SYSCALL_DEFINE6 宏會(huì)展開成一堆宏,后者經(jīng)過(guò)一波復(fù)雜操作創(chuàng)建出一個(gè)帶 6 個(gè)參數(shù)的系統(tǒng)調(diào)用(因此叫 DEFINE6)。作為結(jié)果之一,會(huì)看到內(nèi)核中的所有系統(tǒng)調(diào)用都帶 sys_前綴。

sendto 代碼會(huì)先將數(shù)據(jù)整理成底層可以處理的格式,然后調(diào)用 sock_sendmsg。特別地, 它將傳遞給 sendto 的地址放到另一個(gè)變量(msg)中:

iov.iov_base = buff;

iov.iov_len = len;

msg.msg_name = NULL;

msg.msg_iov = &iov;

msg.msg_iovlen = 1;

msg.msg_control = NULL;

msg.msg_controllen = 0;

msg.msg_namelen = 0;

if (addr) {

err = move_addr_to_kernel(addr, addr_len, &address);

if (err 《 0)

goto out_put;

msg.msg_name = (struct sockaddr *)&address;

msg.msg_namelen = addr_len;

}

這段代碼將用戶程序傳入到內(nèi)核的(存放待發(fā)送數(shù)據(jù)的)地址,作為 msg_name 字段嵌入到 struct msghdr 類型變量中。這和用戶程序直接調(diào)用 sendmsg 而不是 sendto 發(fā)送數(shù)據(jù)差不多,這之所以可行,是因?yàn)?sendto 和 sendmsg 底層都會(huì)調(diào)用 sock_sendmsg。

4.1 sock_sendmsg, __sock_sendmsg, __sock_sendmsg_nosec

sock_sendmsg 做一些錯(cuò)誤檢查,然后調(diào)用__sock_sendmsg;后者做一些自己的錯(cuò)誤檢查 ,然后調(diào)用__sock_sendmsg_nosec。__sock_sendmsg_nosec 將數(shù)據(jù)傳遞到 socket 子系統(tǒng)的更深處:

static inline int __sock_sendmsg_nosec(struct kiocb *iocb, struct socket *sock,

struct msghdr *msg, size_t size)

{

struct sock_iocb *si = 。。。。

/* other code 。。。 */

return sock-》ops-》sendmsg(iocb, sock, msg, size);

}

通過(guò)前面介紹的 socket 創(chuàng)建過(guò)程,可以知道注冊(cè)到這里的 sendmsg 方法就是 inet_sendmsg。

4.2 inet_sendmsg

從名字可以猜到,這是 AF_INET 協(xié)議族提供的通用函數(shù)。此函數(shù)首先調(diào)用 sock_rps_record_flow 來(lái)記錄最后一個(gè)處理該(數(shù)據(jù)所屬的)flow 的 CPU; Receive Packet Steering 會(huì)用到這個(gè)信息。接下來(lái),調(diào)用 socket 的協(xié)議類型(本例是 UDP)對(duì)應(yīng)的 sendmsg 方法:

int inet_sendmsg(struct kiocb *iocb, struct socket *sock, struct msghdr *msg,

size_t size)

{

struct sock *sk = sock-》sk;

sock_rps_record_flow(sk);

/* We may need to bind the socket. */

if (!inet_sk(sk)-》inet_num && !sk-》sk_prot-》no_autobind && inet_autobind(sk))

return -EAGAIN;

return sk-》sk_prot-》sendmsg(iocb, sk, msg, size);

}

EXPORT_SYMBOL(inet_sendmsg);

本例是 UDP 協(xié)議,因此上面的 sk-》sk_prot-》sendmsg 指向的是之前看到的(通過(guò) udp_prot 導(dǎo)出的)udp_sendmsg 函數(shù)。

sendmsg()函數(shù)作為分界點(diǎn),處理邏輯從 AF_INET 協(xié)議族通用處理轉(zhuǎn)移到具體的 UDP 協(xié)議的處理。

5. 總結(jié)

了解Linux內(nèi)核網(wǎng)絡(luò)數(shù)據(jù)包發(fā)送的詳細(xì)過(guò)程,有助于我們進(jìn)行網(wǎng)絡(luò)監(jiān)控和調(diào)優(yōu)。本文只分析了協(xié)議層的注冊(cè)和通過(guò) socket 發(fā)送數(shù)據(jù)的過(guò)程,數(shù)據(jù)在傳輸層和網(wǎng)絡(luò)層的詳細(xì)發(fā)送過(guò)程將在下一篇文章中分析。

參考鏈接:

[1] https://blog.packagecloud.io/eng/2017/02/06/monitoring-tuning-linux-networking-stack-sending-data

[2] https://segmentfault.com/a/1190000008926093

本系列文章1-4,來(lái)源于陳莉君老師公眾號(hào)“Linux內(nèi)核之旅”

編輯:jq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 內(nèi)核
    +關(guān)注

    關(guān)注

    4

    文章

    1468

    瀏覽量

    42881

原文標(biāo)題:Linux內(nèi)核網(wǎng)絡(luò)udp數(shù)據(jù)包發(fā)送(一)

文章出處:【微信號(hào):gh_6fde77c41971,微信公眾號(hào):FPGA干貨】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    TCP/IP(Socket協(xié)議深度剖析

    TCP/IP協(xié)議作為互聯(lián)網(wǎng)通信的基礎(chǔ)架構(gòu),其核心機(jī)制Socket編程承載著全球數(shù)據(jù)交換的使命。本文將深入剖析這一協(xié)議的七架構(gòu)、三次握手與四次揮手的精妙設(shè)計(jì)、流量控制與擁塞控制的動(dòng)態(tài)平
    的頭像 發(fā)表于 03-03 17:06 ?497次閱讀

    進(jìn)迭時(shí)空 Upstream | K3 獲得 Linux 7.0 內(nèi)核原生支持

    2026年2月22日,隨著Linux內(nèi)核正式發(fā)布v7.0-rc1版本,全球開源社區(qū)迎來(lái)了RISC-V生態(tài)的歷史性跨越。進(jìn)迭時(shí)空(SpacemiT)研發(fā)的高性能RISC-VAICPU芯片K3作為全球首
    的頭像 發(fā)表于 02-27 18:10 ?9413次閱讀
    <b class='flag-5'>進(jìn)</b>迭時(shí)空 Upstream | K3 獲得 Linux 7.0 <b class='flag-5'>內(nèi)核</b>原生支持

    socket是什么

    Socket(套接字)是計(jì)算機(jī)網(wǎng)絡(luò)中的一個(gè)概念,它指示了一個(gè)可以進(jìn)行網(wǎng)絡(luò)通信的軟件端點(diǎn)。通過(guò)使用Socket,計(jì)算機(jī)程序可以通過(guò)網(wǎng)絡(luò)進(jìn)行通信。Socket API提供了一套標(biāo)準(zhǔn)的網(wǎng)絡(luò)通信接口,可用
    發(fā)表于 12-03 08:27

    Linux內(nèi)核模塊的加載機(jī)制

    內(nèi)核模塊是什么? 內(nèi)核模塊是動(dòng)態(tài)加載到內(nèi)核中的代碼,可以在不重啟系統(tǒng)的情況下擴(kuò)展功能,比如設(shè)備驅(qū)動(dòng)或者文件系統(tǒng)支持。這樣用戶不需要把所有功能都編譯進(jìn)
    發(fā)表于 11-25 06:59

    蜂鳥內(nèi)核ITCM模塊以及取值過(guò)程

    的結(jié)構(gòu)以及從ITCM中取值的過(guò)程。 模塊介紹 首先,我們先得知道ITCM模塊存儲(chǔ)位置是在e203_CPU_top下。 而我們看ITCM的代碼下只有一個(gè)子模塊 該子模塊是sram的通用模塊,也就是說(shuō)
    發(fā)表于 10-24 08:29

    FTTR-B主網(wǎng)關(guān)二透?jìng)髋渲?b class='flag-5'>過(guò)程

    透?jìng)鳎↙ayer 2 Transparent Transmission)指在數(shù)據(jù)鏈路層(OSI第二)上,數(shù)據(jù)幀在傳輸過(guò)程中保持原始的二信息(如MAC地址、VLAN標(biāo)簽等)不變,
    的頭像 發(fā)表于 08-20 10:23 ?1506次閱讀
    FTTR-B主網(wǎng)關(guān)二<b class='flag-5'>層</b>透?jìng)髋渲?b class='flag-5'>過(guò)程</b>

    GraniStudio : TCP/IP(Socket協(xié)議深度剖析

    在工業(yè)自動(dòng)化與物聯(lián)網(wǎng)領(lǐng)域,TCP/IP(Socket協(xié)議作為應(yīng)用最廣泛的網(wǎng)絡(luò)通信標(biāo)準(zhǔn),是實(shí)現(xiàn)設(shè)備間數(shù)據(jù)交互的核心技術(shù)。GraniStudio 軟件作為工業(yè)級(jí)零代碼開發(fā)平臺(tái),其內(nèi)置的 TCP/IP
    的頭像 發(fā)表于 08-03 22:20 ?1200次閱讀
    GraniStudio : TCP/IP(<b class='flag-5'>Socket</b>)<b class='flag-5'>協(xié)議</b>深度剖析

    如何排除 USB 協(xié)議分析儀測(cè)試中的干擾源?

    5GHz),或增大主機(jī)PC的USB緩沖區(qū)(通過(guò)注冊(cè)表修改)。 總結(jié)排除USB協(xié)議分析儀測(cè)試中的干擾需遵循“從物理到邏輯、從局部到全局”的原則: 優(yōu)先檢查物理(電纜、電源、EMI),確
    發(fā)表于 08-01 15:00

    第二十四章 W55MH32TCP_Client_Multi_Socket示例

    及處理連接關(guān)閉的完整過(guò)程。文章詳細(xì)介紹了 TCP?協(xié)議的概念、特點(diǎn)、與 UDP?的區(qū)別、應(yīng)用場(chǎng)景、數(shù)據(jù)交互流程、ACK?機(jī)制、重傳機(jī)制和 Keepalive?機(jī)制,幫助讀者理解其在可靠數(shù)據(jù)傳輸中的實(shí)際應(yīng)用價(jià)值。
    的頭像 發(fā)表于 07-24 16:08 ?1000次閱讀
    第二十四章 W55MH32TCP_Client_Multi_<b class='flag-5'>Socket</b>示例

    協(xié)議分析儀能檢測(cè)藍(lán)牙設(shè)備的哪些潛在問(wèn)題?

    協(xié)議分析儀能夠檢測(cè)藍(lán)牙設(shè)備從物理到應(yīng)用的全鏈路潛在問(wèn)題,具體涵蓋以下方面:一、物理(PHY Layer)問(wèn)題 信號(hào)衰減與遮擋 RSS
    發(fā)表于 07-21 14:27

    協(xié)議分析儀需要支持哪些常見(jiàn)協(xié)議?

    設(shè)備:Keysight U4301B(支持Thunderbolt 3/4物理分析)。 調(diào)試重點(diǎn):PCIe隧道協(xié)議、DisplayPort Alt Mode、熱插拔時(shí)序。 HDMI
    發(fā)表于 07-17 15:40

    藍(lán)牙協(xié)議分析儀能檢測(cè)哪些問(wèn)題?

    儀顯示應(yīng)用未處理特定按鍵的HID報(bào)告(Report ID=0x05未注冊(cè))。 車載藍(lán)牙系統(tǒng)崩潰,捕獲到應(yīng)用發(fā)送非法指令導(dǎo)致協(xié)議棧溢出。 2. 性能瓶頸 檢測(cè)內(nèi)容: 吞吐量
    發(fā)表于 07-15 15:52

    VirtualLab Fusion應(yīng)用:氧化硅膜的可變角橢圓偏振光譜(VASE)分析

    極化分量)的比率?,并輸出相位差?,以及振幅分量Ψ,根據(jù) 在VirtualLab Fusion中,復(fù)數(shù)系數(shù)?p和?s是通過(guò)應(yīng)用嚴(yán)格耦合波分析(RCWA),也被稱為傅里葉模態(tài)法(FMM)來(lái)計(jì)算。因此,在
    發(fā)表于 06-05 08:46

    Essential Macleod應(yīng)用反演工程對(duì)四減反膜進(jìn)行分析

    有很多的過(guò)程可以稱之為反演工程,但在Essential Macleod中,該術(shù)語(yǔ)的意思是用來(lái)識(shí)別理想設(shè)計(jì)的和實(shí)際生產(chǎn)嘗試之間的差異。該功能大致可以概括為“出了什么問(wèn)題”。這一過(guò)程類似于優(yōu)化,在優(yōu)化
    發(fā)表于 05-16 08:45

    NVMe協(xié)議簡(jiǎn)要分析

    具有更高的吞吐量、更快的訪問(wèn)速度和更低的功耗,已經(jīng)廣泛應(yīng)用于各種計(jì)算領(lǐng)域和存儲(chǔ)系統(tǒng)。 1. NVMe隊(duì)列 NVMe協(xié)議采用成對(duì)的提交隊(duì)列(Submission Queue,SQ)和完成隊(duì)列
    發(fā)表于 05-15 00:34