2026-06-23 · 🧠 模型← 本期
Sakana Fugu Technical Report
如果你在做 agent 系统、或者在纠结到底该选哪个基座模型,这条值得停下来看。Sakana 的 Fugu 给出的是另一条路:与其押注某一个全能模型,不如承认现实——不同厂商的前沿模型已经在各自领域各有所长,于是问题变成「怎么把这些专长拼成一个集体智能系统」。Fugu 就是为回答这个问题而生的一族「编排者模型」(orchestrator models)。
先说清楚 Fugu 到底是什么,因为名字容易让人误会。它不是一个调度脚本,也不是一个固定的多智能体框架,而是一个被训练出来的语言模型。它的工作是读懂用户的查询,然后动态地设计出一套「智能体脚手架」(agentic scaffold)——也就是临场决定要调用哪些 LLM 智能体、让它们怎么分工协作、用什么样的结构去解这道题。换句话说,编排本身被当成一种可学习的能力交给了模型,而不是由人手写流程。论文的核心主张是:通过这种自适应的脚手架,Fugu 能够触达超过任何单个 LLM 智能体的性能。
团队放出了两个版本,定位区分得很清楚。Fugu 在性能和延迟之间做平衡,面向日常使用;Fugu-Ultra 则把答案质量放在第一位,专门啃最难的问题。这种「快版 + 重版」的分法,本质上是把「编排要花多少算力和时间」这件事交给用户按场景选择——日常问答没必要每次都开全功率,硬骨头才值得让一整队模型反复推敲。
覆盖的基准面相当广,横跨了几个通常很难同时拿下的能力维度:SWE-Bench Pro 和 Terminal Bench 偏真实软件工程与终端操作,LiveCodeBench 偏编程,GPQA-Diamond 是研究生级别的难题,Humanity's Last Exam 是公认极难的综合推理集,CharXiv Reasoning 则考图表理解与推理。论文称在这些任务上,相对其他「可公开获取的模型」达到了 SOTA。这个限定词「publicly accessible」要留意——它把对比范围圈在了能公开拿到的模型上,而不一定是绝对的全球最强。
训练范式上,论文提到组合了大规模微调、进化算法与强化学习。进化算法这条线其实是 Sakana 一以贯之的风格——他们此前在模型融合、自动化方法搜索上就偏爱进化思路,把它用来搜索/优化编排策略是顺理成章的延伸。不过摘要对每一块具体怎么协同、各自贡献多少,并没有展开。
这里必须诚实地把保留说在前面:这份技术报告的摘要没有给出任何一个具体分数。所有「SOTA」「超过单个模型」的说法目前都还停留在定性层面,缺少可比的数字、对照的基线模型清单,也看不到消融。对一个把卖点压在「编排能带来超越个体的增益」上的工作来说,这个增益到底有多大、相对最强的单模型脚手架还是相对朴素调用,是判断分量的关键,而这些恰恰是摘要里看不到的。
落到实处:对做 agent orchestration、router、多模型协作的团队,Fugu 把「编排作为一个被训练的模型能力」这个方向往前推了一步,思路本身有参考价值。但在看到完整论文的数字、明确的对比设置以及第三方未污染复现之前,建议把它当成一个有意思的新范式来跟进,而不是一个已经坐实的结论。此外,报告是否随附开源权重或代码,目前的材料也未明确给出。
相关
- 2026-06-23 · 后训练An Empirical Study of OpenPangu Quantization on Ascend NPUs
- 2026-06-23 · 数据liufeng145/Annoy-PyEdu-Rs-Raw
- 2026-06-23 · 数据liufeng145/Annoy-PyEdu-Rs
- 2026-06-23 · 数据zjhhhh/autoteacher-aime-qwen3-8b-sft-mix