分析結果公開分享

Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5? | S2E63

分享這篇:

影片總結

日本 Sakana AI 推出 Fugu Ultra,串接 Opus、GPT 與 Gemini;實測卻又慢又貴,成果未勝 Opus。

東京新創 Sakana AI 推出 Fugu Ultra,宣稱串接 Opus、GPT 與 Gemini 等前沿模型,表現可比 Anthropic 的 Fable、Mythos。公司由 David Ha 與 Transformer 論文共同作者之一 Lion Jones 創立,選擇以演化和集體智慧組合模型,而非投入資源訓練更大的模型。Fugu Ultra 的 7B 指揮模型會拆解任務、分派子模型並整合答案;其強化學習獎勵依流程格式與答案正確性評分,因此較適合可驗證的數學、程式任務。官方 benchmark 成績亮眼,社群也肯定它在程式碼審查的潛力,但實測顯示運作慢、耗 token、成本高,品質未明顯勝過 Opus。主持人以 20 美元測試 3D 皮卡丘 Flappy Bird,畫面不如 Opus,雖較可玩,仍未達 Fable 5 的體感水準;他認為模型組合概念值得關注,但 Fugu Ultra 尚未兌現宣稱。

章節

  1. 0:00開頭:Sakana AI 推出 Fugu,宣稱媲美 Anthropic Fable 與 Mythos
  2. 1:28AiPPT:網址、Word 與 PDF 可轉簡報,三種模式支援不同風格
  3. 3:09Sakana AI 與 Fugu Ultra:東京新創稱調度三大模型媲美 Fable
  4. 4:42Sakana AI 選擇組合模型:資源有限,David Ha 與 Llion Jones 創辦公司
  5. 6:55Transformer 八位作者全離開 Google,John Jumper 也加入人才流動
  6. 8:55Fugu Ultra:7B 指揮官調度 Opus 4.8、GPT 5.5 與 Gemini 3.1 Pro
  7. 11:15指揮官模型用 RL 安排子任務,答案獎勵分為 0、0.5 與 1 分
  8. 13:22可驗證能力進步較快:數學與程式有回饋,網站品味難量化
  9. 15:08駕馭工程能否撐過六個月:Fugu Ultra benchmark 有勝有負
  10. 17:08社群回饋:Fugu Ultra 擅長 code review,但常比 Opus 4.8 更慢更貴
  11. 18:27皮卡丘 Flappy Bird 實測:二十美元用完仍在除錯,畫面不如 Opus 4.8
  12. 19:32主持人看 Sakana AI:Fugu Ultra 未達期待,但模型組合概念會延續

這是 Tier 1 公開摘要

每章重點、段落總結、心智圖由分享者控制是否公開。想看完整分析?自己提交一支。

同頻道的其他分析

相關主題的分析