跳至主要內容
科技 科普

「基因庫太全,老外看呆」登上貼吧熱榜:14 億張臉什麼都像,基因多樣性的冠軍在非洲

「中國基因庫太全,老外看呆」登上貼吧熱榜,本文用遺傳學區分長相多樣與基因多樣,解釋14億張臉的組合數學與走出非洲的瓶頸效應,並說明外國人驚嘆作為熱榜內容的計分邏輯。

Techroomage 編輯部 閱讀約 8 分鐘
「基因庫太全,老外看呆」登上貼吧熱榜:14 億張臉什麼都像,基因多樣性的冠軍在非洲

外國網友的驚嘆對了一半:長相的組合確實驚人,但人類遺傳變異收藏最豐富的地方在非洲,熱榜詞條把兩把不同的尺壓成了一句話。

「這星球上什麼長相都能在中國找到。」

近日,這句話掛上貼吧熱榜,話題名稱是「中國基因庫太全,老外看呆」,即時討論累積超過四萬四千則。詞條流傳的版本略有出入,一個寫成「外網驚嘆 14 億中國人基因多樣性」,另一個被轉述成「這星球的人都能在中國的任何地方找到和你相似的人」。無論哪一版,內容都一樣薄:沒有具體事件,沒有原始出處,也沒有具名的研究或報告,只有一個結論,配上老外的驚訝。

引言圖卡重現貼吧熱榜詞條中「這星球上什麼長相都能在中國找到」這句外國網友驚嘆的原文

這種連事件都省略的榜單詞條並不罕見,薛之謙深圳演唱會現場那種連事件都省了的熱榜詞條先前就示範過:榜單要的是一句可以直接轉發的話,事件有沒有並不重要。

先把答案放在前面。這句驚嘆對了一半:14 億張臉經過特徵排列組合,確實幾乎什麼樣子都放得下;但「基因庫太全」四個字,把「長相很多樣」和「基因很多樣」當成同一件事,而在人類遺傳變異的地圖上,收藏最豐富的區域在非洲。要看懂這一半對、一半不對,得先回到基因庫在遺傳學裡的本義。

基因庫沒有「全」這個字

遺傳學裡的基因庫,指一個羣體所有成員攜帶的基因變異版本總和。可以用牌來比喻:全人類共用同一套牌的設計,每個人拿到的一副牌內容略有出入,某些牌是這個版本,某些牌是那個版本。一個羣體的基因庫豐富,意思是牌的版本種類多、出現頻率分布得均勻,遺傳學家用對偶基因頻率、異合度這類指標去量它。

「太全」的問題在於,「全」暗示存在一份完整清單,集滿就圓滿了。這份清單並不存在,因為人類是很年輕的物種。現代智人大約在二、三十萬年前出現於非洲,羣體在演化尺度上還來不及累積大量分歧,任意兩個人的基因體序列,相似度都在 99.9% 上下。所有看得見與看不見的人類差異,全部裝在剩下的千分之一裡。

走出非洲的那扇窄門

大約六、七萬年前,有一小羣人離開非洲,後代散布各大洲。這批開路者人數有限,只帶走了非洲族羣基因庫的一部分,此後非洲以外所有人羣的遺傳變異,都是這批存貨的再分配。留在非洲的族羣持續累積變異,累積的時間也長得多。

人口遺傳學稱之為瓶頸效應,可以用圖書館比喻:非洲是總館,藏書最齊;出走的人在外地開分館,只能搬幾個書架的書過去。分館經營得再大、讀者再多,館藏的多樣程度在開館那天就定了上限。所以在人類遺傳變異的地圖上,非洲以內不同族羣之間的差異,大過非洲人與非洲以外族羣之間的差異。若「基因庫太全」指的是版本收藏最豐富,冠軍在非洲,領先幅度還不小。

那麼,外國網友的直覺錯了嗎?也沒有。他們驚嘆的現象是真的,只是量它的尺,和量基因的尺不同。

長相是另一把尺

臉看得見,基因看不見,兩者常被當成同一件事,實際上對不起來。臉上的特徵,膚色深淺、眼瞼形態、鼻樑高低、顴骨寬窄、下顎輪廓、嘴脣厚薄,由數百個基因區段共同影響,再疊上環境與發育過程的隨機。這些特徵還受到人類知覺的特別關照:大腦有一套專門處理臉孔的迴路,對微小差異極度敏感,於是「看起來差很多」和「基因差很多」很容易被劃上等號,但兩者在數量上不成比例。

膚色是最清楚的例子。它隨緯度與紫外線強度被天擇強力塑造,幾千年就足以拉開肉眼可見的差距,而支撐這些差距的遺傳變異,在整個基因體裡只佔很小的角落。長相多樣與基因多樣,經常各走各的路。

14 億張臉的排列組合

那為什麼 14 億人裡,什麼長相都找得到?關鍵在規模。

把一張臉想成一排滑桿:眼距、鼻寬、脣厚、頭型、髮際,每個滑桿都有一段連續的可動範圍。理論上的組合數是天文數字,但人腦解析度有限,記不住連續值,只記得住大概位置,於是兩張臉要在知覺上算「像」,需要的重疊遠比直覺少。數學上有個生日悖論:房間裡只要有 23 個人,就有超過一半的機率出現兩人同一天生日,因為配對數量隨人數平方級上升。14 億人兩兩配對,數量接近 10 的 18 次方量級,在這麼大的樣本裡,任何一張臉找到知覺上的替身,機率高得平常。

統計圖卡呈現生日悖論的門檻數字二十三人,說明房間裡有二十三人即有一半以上機率出現同一天生日的兩人
配對數隨人數平方級成長,相似比直覺容易出現

中國的地理跨度和歷史上的南北遷徙、族羣流動,確實讓長相分布的範圍很大,這部分是真的。但「什麼長相都有」終究是人口規模帶來的性質:十幾億人口的印度同樣什麼長相都有,80 億人的地球更是。把句子反過來念也成立:中國的任何一張臉,都能在這星球的其他地方找到相似的人。樣本夠大的時候,相似是雙向的。

看呆的必須是老外

回到熱榜本身,這個話題最值得注意的地方也許是主詞。

「中國人長相很多樣」這件事,中國網友自己天天都在驗證,構不成話題。換成外國網友的驚訝,同一件事就有了證詞的分量:自己說好不算數,外人說好才算數。這套計分邏輯,我們在日本網友的一桌中國周邊被貼吧認證為真愛的案例裡已經看過,外來者的肯定比自己的肯定值錢,因為它看起來中立。至於那位外國網友是誰、在哪個平臺說的、原始脈絡長什麼樣,詞條一概不提供。

這類詞條的生產成本趨近於零:一句轉述、一種情緒、一個榜單位置,就能換四萬多則討論。查證的成本則由讀者承擔,而大多數人轉發的速度,永遠快於查證的速度。

下次再看到這類驚嘆

這類話題不會只出現一次。之後再遇到「某個外國人驚嘆中國某件事」的榜單,有幾個檢查可以做。先分辨尺:說的是長相(表型)還是基因(遺傳變異),兩者經常各走各的路,甚至方向相反。再分辨數學:結論來自規模效應還是獨特性,判斷的方法是把句子反過來念,反方向也成立,就代表這是樣本大小的性質。最後看驚嘆者:當驚嘆者的身分比證據的內容更顯眼,這則內容的功能更接近情緒供給,離資訊比較遠。

清單圖卡列出檢視外國人驚嘆類說法的四個問題,包括長相與基因之別、規模與獨特之別、反方向是否成立、以及發出驚嘆的人是誰

14 億張臉確實是一座巨大的樣本庫,值得驚嘆,只是值得驚嘆的位置和詞條說的不同。遺傳學想說的其實是另一件事:人類是極年輕、彼此極相近的物種,任何一地的長相分布,都是同一副牌洗出來的另一種排法。差異是真實的,尺度卻常被知覺放大。把這一步想清楚,比看呆多走了一步,而這一步剛好是熱榜詞條裝不下的部分。

#科技科普#人類遺傳學#熱榜話題解讀