AI 解碼在約 60% 人類基因中發現的 DNA 起始序列
2026/08/24
研究團隊以 AI 解碼出現在約 60% 人類基因中的 DNA 起始序列,為理解基因表現的調控機制提供了新的線索。這類序列決定了基因在什麼時候、以多大的強度被啟動。
要理解起始序列的重要性,得先看基因表現的運作。人體幾乎所有細胞都含有相同的基因體,但肝細胞、神經細胞與肌肉細胞的功能截然不同——差異不在基因本身,而在哪些基因被開啟、開啟到什麼程度。控制這個開關的,正是基因前端的調控序列;而起始子(initiator)是其中決定轉錄從何處開始的關鍵元件。
這類序列之所以難以辨識,在於它們的模式並不嚴格。與蛋白質編碼區有明確的密碼子規則不同,調控序列的特徵是統計性的——某些鹼基組合出現的機率較高,但並非固定不變;同時,其功能還受到周邊序列與染色質狀態的影響。這種「模糊但有規律」的特性,正好是機器學習方法的適用範圍。
AI 在這裡的作用,是從海量的基因體資料中找出人類難以歸納的模式。傳統方法依賴研究者提出假設再驗證,而模型能同時考量數萬個位置的組合關係,發現超出既有理論框架的規律。當模型辨識出的序列模式在約 60% 的人類基因中出現,其普遍性便顯示這不是巧合,而是一個基礎性的調控機制。
實際的應用價值分幾個層面。基礎研究上,理解調控機制有助於解釋為何相同的基因在不同組織中表現差異巨大;疾病研究上,許多疾病的成因並非基因本身突變,而是調控失常導致表現量異常——若能定位到調控序列,診斷與治療的切入點便更明確。
在生物技術應用上,這類知識同樣關鍵。基因治療與細胞工程需要精確控制導入基因的表現量——過高或過低都可能造成問題;而合成生物學設計人工基因線路時,也需要可預測的調控元件。對起始序列的理解,直接提升了這些設計的可控性。
不過,從序列辨識到功能驗證之間仍有距離。模型指出某段序列可能具有調控功能,仍需透過實驗確認其實際效果——而這正是 AI 應用於生命科學的共同瓶頸:假設產生的速度遠超過實驗驗證的能力。這也是近期關於「AI 治病的真正瓶頸在生物資料與研究設施」討論的核心。
後續觀察重點包括:實驗驗證的結果、該機制在不同物種間的保守程度,以及在疾病研究上的具體應用。