一项名为 FLM(Fly Language Model)的实验于 9 月 11 日公开,它把果蝇大脑的接线图直接当作计算元件接到语言模型旁边。16 万 6,700 个节点的实测连接组被放在一个冻结的 1.2B 模型旁,只训练约 27 万参数的读出层。耐人寻味的是,作者自己设置的对照组成绩略好,并且明确写道果蝇的接线并未体现出优势。

把果蝇大脑当作「蓄水池」

FLM 采用的是被称为储备池计算的思路:内部权重保持固定不参与训练,信号流过之后只训练负责读出回响的那一层。这套被命名为 GPF(Generative Pre-trained Fly)的结构,特别之处在于固定权重矩阵里装的不是人工随机数,而是以 MaleCNS v1.0 名义公开的果蝇中枢神经系统连接组本身。

所用的图包含 16 万 6,700 个节点和 2,558 万 2,938 条有向连接,矩阵数值来自解剖学接触量测量值的归一化结果。语言模型一侧 2,048 维的词元嵌入,经固定的高斯投影压缩到 128 个通道,每个节点接收其中一个通道。状态更新遵循 x = tanh(W(0.6x + 0.4Bc)),即按 6 成旧状态与 4 成新输入的比例混合,推动果蝇图前进一步。

只训练 27 万参数

作为底座的语言模型是 Liquid AI 的 LFM2.5-1.2B-Instruct,其 11.7 亿参数完全不动。参与训练的只有两个无偏置矩阵(128×128 与 2,048×128),合计 27 万 8,528 个参数,占整体的 0.024%。训练素材也很小,只有 64 组对话数据和 32 个合成样本。

代码以 MIT 许可证发布在 GitHub 上,运行环境为 Python 3.12。作者还提供了可在浏览器中试用的演示,并注明由于模型很小,回复可能并不完善。

改善 0.0222 nat,但对照组略胜一筹

评测覆盖 32 组对话、1,236 个词元,指标是每词元的负对数似然(nat)。数值越小,说明对下一个词的预测越准。

保持冻结的底座模型为 1.381995。加上果蝇读出层后降至 1.359816(3 个随机种子的标准差为 0.000110),改善幅度为 0.0222 nat。然而,若换成参数量相同、只把输入直接读出的对照组,结果是 1.359328,略微胜过果蝇版本。差距为 0.000488 nat,而且在 27、28、29 三个种子上对照组全部占优。

作者的结论很干脆:连接组这张图确实对预测产生了可测量的影响,但在本次评测中并没有超过更简单的对照组。

拆解「起作用」的具体内容

值得关注的是,研究没有止步于有没有效果,而是进一步拆解了这张图究竟做了什么。

把权重矩阵 W 置零后,残差完全消失,证明图确实参与了计算。而一旦打乱节点标签,在不重新训练的情况下性能就会崩坏,说明接线结构本身与结果相关联。不过考察递归过程可以看到,初始状态的差异每过一个词元就缩小到 0.6 倍,几乎没有保持长程上下文的能力。

来自果蝇的残差真正改写预测词元的位置,只占全部位置的 1.51%(标准差 0.047%)。有影响,但远谈不上主导。

这个结果该怎么读

在把生物神经回路引入机器学习的研究里,微小的改善常被讲述成接线之妙。这次尝试的价值在于,作者自己跑了条件相同的对照组,并指出改善并非来自结构。如果只截取比底座模型更好的数字,要写出一个乐观的标题并不难。

话虽如此,评测规模只有 32 组对话、1,236 个词元和 3 个种子。这个体量不足以推广结论,改变压缩到 128 通道的设定或混合比例,也仍有得出不同结果的余地。这并不是说果蝇的接线不适合语言处理,而应当被读作在本条件下未能证明优势的一份报告。

总结

FLM 把果蝇 16 万 6,700 个节点的连接组作为固定计算元件接入语言模型,只训练 27 万 8,528 个参数的读出层。它比底座模型改善了 0.0222 nat,而同等规模的简单对照组又领先它 0.000488 nat。接线确实参与了计算,但没有证据显示其结构带来了优势。

※图片仅为示意图