內容: 一、鏈表數據結構簡介 二、Linux 2.6內核鏈表數據結構的實現 三、鏈表操作接口 四、擴展 五、示例 參考資料 關于作者 對" name="description" />
深入分析 Linux 內核鏈表 | ![]() | ![]() | |||
![]() | |||||
![]() |
![]() |
本文詳細分析了 2.6.x 內核中鏈表結構的實現,并通過實例對每個鏈表操作接口進行了詳盡的講解。 一、鏈表數據結構簡介 通常鏈表數據結構至少應包含兩個域:數據域和指針域,數據域用于存儲數據,指針域用于建立與下一個節點的聯系。按照指針域的組織以及各個節點之間的聯系形式,鏈表又可以分為單鏈表、雙鏈表、循環鏈表等多種類型,下面分別給出這幾類常見鏈表類型的示意圖: 1.單鏈表 圖1 單鏈表 單鏈表是最簡單的一類鏈表,它的特點是僅有一個指針域指向后繼節點(next),因此,對單鏈表的遍歷只能從頭至尾(通常是NULL空指針)順序進行。 2.雙鏈表 圖2 雙鏈表 通過設計前驅和后繼兩個指針域,雙鏈表可以從兩個方向遍歷,這是它區別于單鏈表的地方。如果打亂前驅、后繼的依賴關系,就可以構成"二叉樹";如果再讓首節點的前驅指向鏈表尾節點、尾節點的后繼指向首節點(如圖2中虛線部分),就構成了循環鏈表;如果設計更多的指針域,就可以構成各種復雜的樹狀數據結構。 3.循環鏈表 在Linux內核中使用了大量的鏈表結構來組織數據,包括設備列表以及各種功能模塊中的數據組織。這些鏈表大多采用在[include/linux/list.h]實現的一個相當精彩的鏈表數據結構。本文的后繼部分就將通過示例詳細介紹這一數據結構的組織和使用。 二、Linux 2.6內核鏈表數據結構的實現 鏈表數據結構的定義很簡單(節選自[include/linux/list.h],以下所有代碼,除非加以說明,其余均取自該文件):
list_head結構包含兩個指向list_head結構的指針prev和next,由此可見,內核的鏈表具備雙鏈表功能,實際上,通常它都組織成雙循環鏈表。 和第一節介紹的雙鏈表結構模型不同,這里的list_head沒有數據域。在Linux內核鏈表中,不是在鏈表結構中包含數據,而是在數據結構中包含鏈表節點。 在數據結構課本中,鏈表的經典定義方式通常是這樣的(以單鏈表為例):
因為ElemType的緣故,對每一種數據項類型都需要定義各自的鏈表結構。有經驗的C++程序員應該知道,標準模板庫中的<list>采用的是C++ Template,利用模板抽象出和數據項類型無關的鏈表操作接口。 在Linux內核鏈表中,需要用鏈表組織起來的數據通常會包含一個structlist_head成員,例如在[include/linux/netfilter.h]中定義了一個nf_sockopt_ops結構來描述Netfilter為某一協議族準備的getsockopt/setsockopt接口,其中就有一個(struct list_headlist)成員,各個協議族的nf_sockopt_ops結構都通過這個list成員組織在一個鏈表中,表頭是定義在[net/core/netfilter.c]中的nf_sockopts(structlist_head)。從下圖中我們可以看到,這種通用的鏈表結構避免了為每個數據項類型定義自己的鏈表的麻煩。Linux的簡捷實用、不求完美和標準的風格,在這里體現得相當充分。 圖3 nf_sockopts鏈表示意圖 三、鏈表操作接口 1.聲明和初始化
當我們用LIST_HEAD(nf_sockopts)聲明一個名為nf_sockopts的鏈表頭時,它的next、prev指針都初始化為指向自己,這樣,我們就有了一個空鏈表,因為Linux用頭指針的next是否指向自己來判斷鏈表是否為空:
除了用LIST_HEAD()宏在聲明的時候初始化一個鏈表以外,Linux還提供了一個INIT_LIST_HEAD宏用于運行時初始化鏈表:
我們用INIT_LIST_HEAD(&nf_sockopts)來使用它。 2.插入/刪除/合并 對鏈表的插入操作有兩種:在表頭插入和在表尾插入。Linux為此提供了兩個接口:
因為Linux鏈表是循環表,且表頭的next、prev分別指向鏈表中的第一個和最末一個節點,所以,list_add和list_add_tail的區別并不大,實際上,Linux分別用
和
來實現兩個接口,可見,在表頭插入是插入在head之后,而在表尾插入是插入在head->prev之后。 假設有一個新nf_sockopt_ops結構變量new_sockopt需要添加到nf_sockopts鏈表頭,我們應當這樣操作:
從這里我們看出,nf_sockopts鏈表中記錄的并不是new_sockopt的地址,而是其中的list元素的地址。如何通過鏈表訪問到new_sockopt呢?下面會有詳細介紹。 b)刪除
當我們需要刪除nf_sockopts鏈表中添加的new_sockopt項時,我們這么操作:
被剔除下來的new_sockopt.list,prev、next指針分別被設為LIST_POSITION2和LIST_POSITION1兩個特殊值,這樣設置是為了保證不在鏈表中的節點項不可訪問--對LIST_POSITION1和LIST_POSITION2的訪問都將引起頁故障。與之相對應,list_del_init()函數將節點從鏈表中解下來之后,調用LIST_INIT_HEAD()將節點置為空鏈狀態。 c)搬移 Linux提供了將原本屬于一個鏈表的節點移動到另一個鏈表的操作,并根據插入到新鏈表的位置分為兩類:
例如list_move(&new_sockopt.list,&nf_sockopts)會把new_sockopt從它所在的鏈表上刪除,并將其再鏈入nf_sockopts的表頭。 d)合并 除了針對節點的插入、刪除操作,Linux鏈表還提供了整個鏈表的插入功能:
假設當前有兩個鏈表,表頭分別是list1和list2(都是structlist_head變量),當調用list_splice(&list1,&list2)時,只要list1非空,list1鏈表的內容將被掛接在list2鏈表上,位于list2和list2.next(原list2表的第一個節點)之間。新list2鏈表將以原list1表的第一個節點為首節點,而尾節點不變。如圖(虛箭頭為next指針): 圖4 鏈表合并list_splice(&list1,&list2) 當list1被掛接到list2之后,作為原表頭指針的list1的next、prev仍然指向原來的節點,為了避免引起混亂,Linux提供了一個list_splice_init()函數:
該函數在將list合并到head鏈表的基礎上,調用INIT_LIST_HEAD(list)將list設置為空鏈。 3.遍歷 a)由鏈表節點到數據項變量 我們知道,Linux鏈表中僅保存了數據項結構中list_head成員變量的地址,那么我們如何通過這個list_head成員訪問到作為它的所有者的節點數據呢?Linux為此提供了一個list_entry(ptr,type,member)宏,其中ptr是指向該數據中list_head成員的指針,也就是存儲在鏈表中的地址值,type是數據項的類型,member則是數據項類型定義中list_head成員的變量名,例如,我們要訪問nf_sockopts鏈表中首個nf_sockopt_ops變量,則如此調用:
這里"list"正是nf_sockopt_ops結構中定義的用于鏈表操作的節點成員變量名。 list_entry的使用相當簡單,相比之下,它的實現則有一些難懂:
size_t最終定義為unsigned int(i386)。 這里使用的是一個利用編譯器技術的小技巧,即先求得結構成員在與結構中的偏移量,然后根據成員變量的地址反過來得出屬主結構變量的地址。 container_of()和offsetof()并不僅用于鏈表操作,這里最有趣的地方是((type*)0)->member,它將0地址強制"轉換"為type結構的指針,再訪問到type結構中的member成員。在container_of宏中,它用來給typeof()提供參數(typeof()是gcc的擴展,和sizeof()類似),以獲得member成員的數據類型;在offsetof()中,這個member成員的地址實際上就是type數據結構中member成員相對于結構變量的偏移量。 如果這么說還不好理解的話,不妨看看下面這張圖: 圖5 offsetof()宏的原理 對于給定一個結構,offsetof(type,member)是一個常量,list_entry()正是利用這個不變的偏移量來求得鏈表數據項的變量地址。 b)遍歷宏 在[net/core/netfilter.c]的nf_register_sockopt()函數中有這么一段話:
函數首先定義一個(struct list_head *)指針變量i,然后調用list_for_each(i,&nf_sockopts)進行遍歷。在[include/linux/list.h]中,list_for_each()宏是這么定義的:
它實際上是一個for循環,利用傳入的pos作為循環變量,從表頭head開始,逐項向后(next方向)移動pos,直至又回到head(prefetch()可以不考慮,用于預取以提高遍歷速度)。 那么在nf_register_sockopt()中實際上就是遍歷nf_sockopts鏈表。為什么能直接將獲得的list_head成員變量地址當成struct nf_sockopt_ops數據項變量的地址呢?我們注意到在structnf_sockopt_ops結構中,list是其中的第一項成員,因此,它的地址也就是結構變量的地址。更規范的獲得數據變量地址的用法應該是:
大多數情況下,遍歷鏈表的時候都需要獲得鏈表節點數據項,也就是說list_for_each()和list_entry()總是同時使用。對此Linux給出了一個list_for_each_entry()宏:
與list_for_each()不同,這里的pos是數據項結構指針類型,而不是(struct list_head *)。nf_register_sockopt()函數可以利用這個宏而設計得更簡單:
某些應用需要反向遍歷鏈表,Linux提供了list_for_each_prev()和list_for_each_entry_reverse()來完成這一操作,使用方法和上面介紹的list_for_each()、list_for_each_entry()完全相同。 如果遍歷不是從鏈表頭開始,而是從已知的某個節點pos開始,則可以使用list_for_each_entry_continue(pos,head,member)。有時還會出現這種需求,即經過一系列計算后,如果pos有值,則從pos開始遍歷,如果沒有,則從鏈表頭開始,為此,Linux專門提供了一個list_prepare_entry(pos,head,member)宏,將它的返回值作為list_for_each_entry_continue()的pos參數,就可以滿足這一要求。 4.安全性考慮 a)list_empty()判斷 基本的list_empty()僅以頭指針的next是否指向自己來判斷鏈表是否為空,Linux鏈表另行提供了一個list_empty_careful()宏,它同時判斷頭指針的next和prev,僅當兩者都指向自己時才返回真。這主要是為了應付另一個cpu正在處理同一個鏈表而造成next、prev不一致的情況。但代碼注釋也承認,這一安全保障能力有限:除非其他cpu的鏈表操作只有list_del_init(),否則仍然不能保證安全,也就是說,還是需要加鎖保護。 b)遍歷時節點刪除 前面介紹了用于鏈表遍歷的幾個宏,它們都是通過移動pos指針來達到遍歷的目的。但如果遍歷的操作中包含刪除pos指針所指向的節點,pos指針的移動就會被中斷,因為list_del(pos)將把pos的next、prev置成LIST_POSITION2和LIST_POSITION1的特殊值。 當然,調用者完全可以自己緩存next指針使遍歷操作能夠連貫起來,但為了編程的一致性,Linux鏈表仍然提供了兩個對應于基本遍歷操作的"_safe"接口:list_for_each_safe(pos, n, head)、list_for_each_entry_safe(pos, n,head,member),它們要求調用者另外提供一個與pos同類型的指針n,在for循環中暫存pos下一個節點的地址,避免因pos節點被釋放而造成的斷鏈。 四、擴展 1.hlist 圖6 list和hlist 精益求精的Linux鏈表設計者(因為list.h沒有署名,所以很可能就是LinusTorvalds)認為雙頭(next、prev)的雙鏈表對于HASH表來說"過于浪費",因而另行設計了一套用于HASH表應用的hlist數據結構--單指針表頭雙循環鏈表,從上圖可以看出,hlist的表頭僅有一個指向首節點的指針,而沒有指向尾節點的指針,這樣在可能是海量的HASH表中存儲的表頭就能減少一半的空間消耗。 因為表頭和節點的數據結構不同,插入操作如果發生在表頭和首節點之間,以往的方法就行不通了:表頭的first指針必須修改指向新插入的節點,卻不能使用類似list_add()這樣統一的描述。為此,hlist節點的prev不再是指向前一個節點的指針,而是指向前一個節點(可能是表頭)中的next(對于表頭則是first)指針(struct list_head**pprev),從而在表頭插入的操作可以通過一致的"*(node->pprev)"訪問和修改前驅節點的next(或first)指針。 2.read-copy update 我們知道,系統中數據讀取操作遠多于寫操作,而rwlock機制在smp環境下隨著處理機增多性能會迅速下降(見參考資料4)。針對這一應用背景,IBMLinux技術中心的Paul E.McKenney提出了"讀拷貝更新"的技術,并將其應用于Linux內核中。RCU技術的核心是寫操作分為寫-更新兩步,允許讀操作在任何時候無阻訪問,當系統有寫操作時,更新動作一直延遲到對該數據的所有讀操作完成為止。Linux鏈表中的RCU功能只是LinuxRCU的很小一部分,對于RCU的實現分析已超出了本文所及,有興趣的讀者可以自行參閱本文的參考資料;而對RCU鏈表的使用和基本鏈表的使用方法基本相同。 五、示例 為了簡便,例子采用的是用戶態程序模板,如果需要運行,可采用如下命令編譯:
因為內核鏈表限制在內核態使用,但實際上對于數據結構本身而言并非只能在核態運行,因此,在筆者的編譯中使用"-D__KERNEL__"開關"欺騙"編譯器。 參考資料
|