,難點在 Harness)
一個 Agent 讀到一段原始 DNA在分析記錄里寫下我肉眼就能看到串聯(lián)重復(fù)陣列。寫下這句話的不是人類科學(xué)家。它來自 Anthropic 跑的一次自主基因組挖掘。949 個Claude 會話21.5 小時2.156 億token。最后只交了 19 份報告。其中一份定義了一個全新酶系統(tǒng)名字叫 ART。但工程界更該看的是另一件事。同樣的搜索任務(wù)重跑 10 次沒有一次再看見那串重復(fù)。ART 是什么三個零件加一串沒人看的重復(fù)ART 全稱 array-associated reverse transcriptases。中文一般譯作陣列相關(guān)逆轉(zhuǎn)錄酶。它由三個部分組成。一個逆轉(zhuǎn)錄酶也就是把 RNA 抄回 DNA 的酶。一個緊挨著它的伴侶基因功能未知。還有一長串等間距排列的非編碼 DNA 重復(fù)。這三樣?xùn)|西主要出現(xiàn)在噬菌體基因組里。噬菌體就是感染細(xì)菌的病毒。底層那個逆轉(zhuǎn)錄酶其實早就被記錄過。過去研究巨型噬菌體時就有人見過它。Claude 第一個注意到的是它旁邊的重復(fù)陣列和伴生蛋白。重復(fù)單元長15 到 49 個堿基中間有一個約 15 堿基的回文核心。單元之間的間隔長120 到 220 個堿基而且彼此序列不同。每個陣列有3 到 21 個拷貝跨度0.3 到 4.1 kb。陣列附近找不到任何 cas 基因。所以它不是 CRISPR只是長得像。研究團隊在 95 個同源度 90% 的 RT 簇里找到 28 個帶可檢測陣列。重復(fù)序列在 ART 各支內(nèi)部共享跨支就不共享了。間隔序列在同一個陣列內(nèi)部彼此也基本不相關(guān)。在 MarsHill 和 SA1 這類近緣噬菌體之間間隔按原順序保留。它們的分化速率與旁邊的 RT 基因接近。那個 RT 的 N 端異常長。催化結(jié)構(gòu)域之前有約180 個殘基普通 RT 通常在 50 以內(nèi)。93 個跨過催化區(qū)的成員都保留了 YxDD 基序。濕實驗給出的第一條證據(jù)是轉(zhuǎn)錄。在金黃色葡萄球菌噬菌體 SA1 的感染時間序列里陣列 RNA 在 15 分鐘時占噬菌體 RNA 的8%。它還會被切成邊界固定的幾段短 RNA。團隊把 SA1 的 ART 放進大腸桿菌表達也檢測到了類似片段。陣列 RNA 的豐度遠(yuǎn)高于酶本身。論文的推測是一個酶配了一整套模板或誘餌。但作者把話說得很死。沒證明這個逆轉(zhuǎn)錄酶有活性。沒證明那些短 RNA 是它的底物。為什么它和 CRISPR 不是一回事兩者最容易被混淆的是那串重復(fù)陣列。但把參數(shù)擺在一起看差別相當(dāng)大。特征CRISPR 陣列ART 陣列重復(fù)單元長度約 28 到 37 nt15 到 49 nt間隔長度約 30 nt120 到 220 nt間隔來源既往入侵病毒菌株間頻繁增減陣列內(nèi)互不相關(guān)近緣噬菌體間保序相鄰 cas 基因有無陣列拷貝數(shù)通常數(shù)十3 到 21功能狀態(tài)已做成可編程基因編輯工具完全未知漏斗949 個會話到底在做什么科學(xué)家給 Claude 的簡報只有一句。在 DNA 序列數(shù)據(jù)庫里找有趣的逆轉(zhuǎn)錄酶。數(shù)據(jù)庫規(guī)模是19 億個蛋白簇。Agent 收回約20 萬個RT。給3564 個候選搭檔家族打分。收斂到 20 個深挖最終交 19 份報告。Anthropic 說這種量級的分析人類專家要數(shù)周到數(shù)月。組織方式值得細(xì)看。一個 Agent 規(guī)劃并執(zhí)行任務(wù)另一個 Agent 負(fù)責(zé)復(fù)核。Agent 可以自己開新任務(wù)。ART 不在簡報的目標(biāo)里。簡報要找的是編碼蛋白的搭檔基因。ART 的線索來自一個被否決的候選。Agent 先注意到某類 RT 旁邊總跟著一個未知基因。深挖之后發(fā)現(xiàn)那只是巨型噬菌體自己的 RNA 聚合酶亞基。它否掉了這個關(guān)聯(lián)。但它轉(zhuǎn)念一想巨型噬菌體帶著一個類似 retron 的 RT本身就不尋常。retron 通常是細(xì)菌用來防噬菌體的系統(tǒng)。復(fù)核 Agent 提議retron 的 RT 一般要配合上游的非編碼 RNA。下一個 Agent 順著去查上游。它發(fā)現(xiàn)這些酶的近親上游普遍空出900 多個堿基。這個空間足夠裝下一段 RNA。于是它把一段2900 堿基的原始序列直接讀進了上下文窗口。讀完沒有調(diào)用任何工具。緊接著記錄下來的就是那句我肉眼就能看到。然后它開始懷疑自己。把近兩年新報道的 RT 系統(tǒng)挨個梳理了一遍。自己寫腳本算出該位點有14 個 16 堿基重復(fù)間隔 100 到 200 堿基不等。還主動發(fā)起一輪文獻檢索試圖推翻自己的猜想。全對不上之后才提交報告。報告特別強調(diào)全程沒有運行任何現(xiàn)成的重復(fù)序列查找工具。這串重復(fù)是它通讀原始序列時自己看出來的。把家族定下來靠的不是一次會話Agent 交出候選只是整條鏈的第一步。團隊隨后用 Profile HMM 在宏基因組庫和公開基因組里搜同源。這才有了前面那 95 個 90% 同源的 RT 簇。系統(tǒng)發(fā)育分析把這些 RT 放在 retron 旁邊的一支。結(jié)構(gòu)上它們的聚合酶域能和已解析的 retron、DGR 逆轉(zhuǎn)錄酶疊合。真正不同的是 N 端那 180 個殘基。它在這個家族的每個成員身上都在。但它和任何已知蛋白家族或折疊都只有很弱的相似性。研究團隊因此把它列為 ART 的第二個標(biāo)志。被否決的那一支后來成了對照最初把 Agent 引向 ART 的那些 RT其實屬于姊妹支。它們的 N 端也很長。但在 17 個可評估位點里沒有一個帶重復(fù)陣列。也沒有一個編碼 ART 那種伴侶蛋白。團隊把它們叫作 NART非陣列相關(guān)逆轉(zhuǎn)錄酶。這條支線能留下來恰恰因為否決記錄被完整保存了。為什么這么多年沒人看見工具的窗口太窄論文給了一個很具體的技術(shù)解釋。識別 CRISPR 陣列的常用工具參數(shù)都照 CRISPR 的尺寸設(shè)。MinCED 的默認(rèn)設(shè)置只認(rèn)26 到 50 個堿基的間隔。CRISPRCasFinder 只認(rèn)25 到 60 個堿基。ART 的間隔是 120 到 220 個堿基。本來就在它們的篩查范圍之外。這不是工具的 bug是工具的假設(shè)。而假設(shè)來自已知樣本的分布。當(dāng)真實世界出現(xiàn)分布外的樣本工具會安靜地漏掉它。不報錯不告警只是什么都不返回。研究團隊后來專門寫了一個掃描程序。去找間距在 100 到 450 個堿基之間的重復(fù)。這件事可以用十幾行 Python 復(fù)現(xiàn)。import random def make_art_like_array(unit_len16, copies14, gap_range(120, 220), seed7): 造一段 ART 樣陣列固定重復(fù)單元 長度 120-220nt 且各不相同的間隔。 rng random.Random(seed) unit .join(rng.choice(ACGT) for _ in range(unit_len)) parts [unit] for _ in range(copies - 1): gap .join(rng.choice(ACGT) for _ in range(rng.randint(*gap_range))) parts.append(gap) parts.append(unit) return .join(parts), unit def scan_tandem_arrays(seq, unit_len, gap_min, gap_max, min_copies3): 在指定重復(fù)單元長度與間隔窗口內(nèi)統(tǒng)計串聯(lián)重復(fù)拷貝數(shù)。 unit seq[:unit_len] copies, pos, gaps 1, unit_len, [] while pos unit_len len(seq): nxt seq.find(unit, pos, pos gap_max unit_len) if nxt 0: break gap nxt - pos if gap_min gap gap_max: gaps.append(gap) copies 1 pos nxt unit_len return (copies, gaps) if copies min_copies else (0, []) if __name__ __main__: seq, unit make_art_like_array() print(f陣列長度 {len(seq)}nt重復(fù)單元 {unit}) print(MinCED 默認(rèn)窗口 gap 26-50 :, scan_tandem_arrays(seq, 16, 26, 50)) print(CRISPRCasFinder 窗口 25-60:, scan_tandem_arrays(seq, 16, 25, 60)) print(ART 實測窗口 gap 100-450 :, scan_tandem_arrays(seq, 16, 100, 450))同一個陣列換個間隔窗口結(jié)果完全不同。上面這段腳本只是把參數(shù)窗口擺在一起做對照。它解釋不了 ART 的生物學(xué)但解釋了它為什么能被藏這么久。10 次重跑全錯過可復(fù)現(xiàn)性才是真問題團隊把同樣的搜索任務(wù)重跑了 10 次。幾乎每次完成全面檢索的會話都碰到了 ART 相關(guān)位點。其中兩次還對這一譜系展開了后續(xù)研究。但沒有一次去讀這些 RT 基因上游的 DNA。所以 10 次全部錯過了陣列。論文把原因歸給搜索規(guī)模以及 Agent 行為的不可預(yù)測性。這條比 ART 本身更值得工程團隊停下來看。一個跑一次能出結(jié)果的 Agent 系統(tǒng)不等于一臺可靠的科學(xué)儀器。你沒法把某次會話剛好讀了那段序列寫成 SOP。傳統(tǒng)基因組挖掘的可復(fù)現(xiàn)性來自確定性掃描程序。Agent 挖掘的可復(fù)現(xiàn)性目前來自運氣加提示詞。論文自己的定位也很清楚。這次展示的是異常檢測能力不是一條可復(fù)現(xiàn)的發(fā)現(xiàn)流水線。對照實驗工具越多模型讀得越少論文做了一組固定輸入的對照實驗。把 ART 序列固定下來讓 7 個 Claude 模型分析。再由最強的 Mythos 5 按 10 個關(guān)鍵特征打分。這套評分本身也是模型給的不是人工標(biāo)注。能力最強的四個模型明顯更好。Opus 5.5、Mythos 5.1、Mythos 5、Opus 5 排在前列。Opus 4.6、Opus 4.8、Sonnet 5 落在后面。更關(guān)鍵的是失敗模式。直接給 DNA 時四個最強模型至少90%的嘗試能描述出陣列。改成給文件加工具這個比例最低掉到32%。近四成的嘗試從頭到尾沒讀過 200 個堿基以上的連續(xù)文本。連一個完整的重復(fù)單元都沒看全。直接讀進上下文的 DNA 越長認(rèn)出陣列的比例越高。Mythos 5 在最好的條件下達到96%。投喂方式描述出陣列的比例典型失敗模式直接給 DNA 序列四個最強模型均不低于 90%幾乎不失敗給文件加工具最低 32%近四成嘗試未讀滿 200 堿基連續(xù)文本直接給長 DNAMythos 5 最高 96%讀得越長識別率越高結(jié)論有點反直覺。工具不是越多越好。當(dāng)工具替模型做了找模式這件事模型反而不讀原始數(shù)據(jù)了。而這次發(fā)現(xiàn)恰恰來自直接讀原始序列。論文把它稱為 genomic vision基因組視覺。論文還說這個行為可歸因于 Mythos 5 內(nèi)部對重復(fù) DNA 有響應(yīng)的特定信號。換句話說它是模型內(nèi)部表征的產(chǎn)物不是提示詞寫出來的。它和另一條路線差在哪里論文在討論里做了一個橫向?qū)φ铡K固垢D瞧ぷ饔玫氖菍iT的基因組語言模型。目標(biāo)就是挖非編碼元件。它找到的是 UG27 逆轉(zhuǎn)錄酶旁邊的 ncRNA 陣列。那是一條專用模型的路線。這次是通用模型直接讀 DNA 看出來的。論文據(jù)此認(rèn)為這類陣列架構(gòu)在自然界至少獨立出現(xiàn)過兩次。但兩次的技術(shù)路線完全不同。19 份報告里ART 只排第三19 份報告交上去之后。用 Mythos 5 做兩兩比較打分。ART 那份排在第三位。最終是人類研究員憑經(jīng)驗從排名靠前的幾份里把它挑了出來。自動排序可以給出候選但不能定終局。這輪流程里人類的位置并不只是按一下回車。這也解釋了 Anthropic 為什么反復(fù)強調(diào)所有濕實驗都由人類科學(xué)家完成。把生物學(xué)放一邊五條工程結(jié)論可以帶走第一異常檢測需要原始數(shù)據(jù)進上下文。工具封裝會切斷這條路徑至少在當(dāng)前的模型上是這樣。如果 Agent 只在工具返回值上做判斷它會漏掉分布外的東西。第二可復(fù)現(xiàn)性必須顯式設(shè)計。長跑 Agent 的自由度越高執(zhí)行路徑越難復(fù)現(xiàn)。需要把讀了哪些原始數(shù)據(jù)當(dāng)成一等公民記錄下來。否則你連它為什么成功都說不清。第三篩選環(huán)節(jié)要留人。自動打分可以排序不能定終局。第四工具的默認(rèn)參數(shù)是一份歷史假設(shè)。當(dāng)你要找的是分布外的東西先檢查工具的窗口。第五日志要能回答讀了什么而不只是調(diào)了什么。這次能定位原因靠的是會話記錄里那幾行原始序列和 Agent 的原話。沒有這些記錄10 次重跑失敗只能被解釋成隨機。這五條跟生物學(xué)無關(guān)。任何做 Agent 數(shù)據(jù)挖掘的團隊都會撞上。這次沒有證明什么最后把邊界說清楚。ART 的生物學(xué)功能完全未知。沒證明那個逆轉(zhuǎn)錄酶有活性。沒證明那些短 RNA 是它的底物。沒證明逆轉(zhuǎn)錄酶和伴侶蛋白會結(jié)合。更沒證明它能做基因編輯。論文是預(yù)印本還沒有同行評審。張鋒審閱后的評價是值得進一步研究。他沒說這是下一個 CRISPR。底層那個酶早在過去的巨型噬菌體研究里出現(xiàn)過。Claude 的貢獻是注意到陣列和伴生蛋白。這個貢獻是真的邊界也就在這里。