一項名為 FLM(Fly Language Model)的實驗於 9 月 11 日公開,它把果蠅大腦的接線圖直接當成運算元件,接到語言模型旁邊。16 萬 6,700 個節點的實測連結體被放在一個凍結的 1.2B 模型旁,只訓練約 27 萬參數的讀出層。耐人尋味的是,作者自己設置的對照組成績略勝一籌,並且明確寫出果蠅的接線並未展現優勢。

把果蠅大腦當成「蓄水池」

FLM 採用的是稱為儲備池運算的思路:內部權重維持固定而不參與訓練,訊號流過之後只訓練負責讀出回響的那一層。這套被命名為 GPF(Generative Pre-trained Fly)的架構,特別之處在於固定權重矩陣裡裝的不是人工亂數,而是以 MaleCNS v1.0 名義公開的果蠅中樞神經系統連結體本身。

所使用的圖包含 16 萬 6,700 個節點與 2,558 萬 2,938 條有向連結,矩陣數值來自解剖學接觸量測值的正規化結果。語言模型一側 2,048 維的詞元嵌入,經固定的高斯投影壓縮到 128 個通道,每個節點接收其中一個通道。狀態更新遵循 x = tanh(W(0.6x + 0.4Bc)),也就是以 6 成舊狀態與 4 成新輸入的比例混合,推動果蠅圖前進一步。

只訓練 27 萬個參數

作為底座的語言模型是 Liquid AI 的 LFM2.5-1.2B-Instruct,其 11.7 億參數完全不動。參與訓練的只有兩個無偏置矩陣(128×128 與 2,048×128),合計 27 萬 8,528 個參數,佔整體的 0.024%。訓練素材也相當小,只有 64 組對話資料與 32 個合成範例。

程式碼以 MIT 授權發布在 GitHub 上,執行環境為 Python 3.12。作者另外提供了可在瀏覽器中試用的展示頁,並註明由於模型很小,回覆可能並不完善。

改善 0.0222 nat,但對照組略為領先

評測涵蓋 32 組對話、1,236 個詞元,指標為每個詞元的負對數概似(nat)。數值越小,代表對下一個詞的預測越準確。

維持凍結的底座模型為 1.381995。加上果蠅讀出層後降到 1.359816(3 個隨機種子的標準差為 0.000110),改善幅度是 0.0222 nat。然而改用參數量相同、只把輸入直接讀出的對照組,結果為 1.359328,略微勝過果蠅版本。差距是 0.000488 nat,而且在 27、28、29 三個種子上,對照組全部占優。

作者的結論相當乾脆:連結體這張圖確實對預測產生了可量測的影響,但在這次評測中並沒有超越更單純的對照組。

拆解「有效果」的實際內容

值得注意的是,這項研究沒有停在有沒有效果,而是進一步拆解這張圖究竟做了什麼。

把權重矩陣 W 歸零之後,殘差完全消失,證明圖確實參與了運算。而一旦打亂節點標籤,在不重新訓練的情況下效能就會崩壞,代表接線結構本身與結果相連。不過檢視遞迴過程可以看到,初始狀態的差異每經過一個詞元就縮小為 0.6 倍,幾乎沒有保留長距離脈絡的作用。

來自果蠅的殘差真正改寫預測詞元的位置,只占全部位置的 1.51%(標準差 0.047%)。有影響,但遠談不上主導。

這個結果該怎麼讀

在把生物神經迴路帶進機器學習的研究裡,微小的改善常被描述成接線之妙。這次嘗試的價值在於,作者自己跑了條件相同的對照組,並指出改善並非來自結構。若只擷取比底座模型更好的數字,要寫出樂觀的標題並不困難。

話雖如此,評測規模只有 32 組對話、1,236 個詞元與 3 個種子。這樣的體量不足以推廣結論,改變壓縮到 128 通道的設定或混合比例,也仍有得出不同結果的空間。這並不是說果蠅的接線不適合語言處理,而應當被讀作在此條件下未能證明優勢的一份報告。

總結

FLM 把果蠅 16 萬 6,700 個節點的連結體當成固定運算元件接入語言模型,只訓練 27 萬 8,528 個參數的讀出層。它比底座模型改善了 0.0222 nat,而同等規模的單純對照組又領先它 0.000488 nat。接線確實參與了運算,但沒有證據顯示其結構帶來優勢。

※圖片僅為示意圖