AnalysisPublic share

Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5? | S2E63

Share:

Video summary

日本 Sakana AI 推出 Fugu Ultra,串接 Opus、GPT 與 Gemini;實測卻又慢又貴,成果未勝 Opus。

東京新創 Sakana AI 推出 Fugu Ultra,宣稱串接 Opus、GPT 與 Gemini 等前沿模型,表現可比 Anthropic 的 Fable、Mythos。公司由 David Ha 與 Transformer 論文共同作者之一 Lion Jones 創立,選擇以演化和集體智慧組合模型,而非投入資源訓練更大的模型。Fugu Ultra 的 7B 指揮模型會拆解任務、分派子模型並整合答案;其強化學習獎勵依流程格式與答案正確性評分,因此較適合可驗證的數學、程式任務。官方 benchmark 成績亮眼,社群也肯定它在程式碼審查的潛力,但實測顯示運作慢、耗 token、成本高,品質未明顯勝過 Opus。主持人以 20 美元測試 3D 皮卡丘 Flappy Bird,畫面不如 Opus,雖較可玩,仍未達 Fable 5 的體感水準;他認為模型組合概念值得關注,但 Fugu Ultra 尚未兌現宣稱。

Chapters

  1. 0:00開頭:Sakana AI 推出 Fugu,宣稱媲美 Anthropic Fable 與 Mythos
  2. 1:28AiPPT:網址、Word 與 PDF 可轉簡報,三種模式支援不同風格
  3. 3:09Sakana AI 與 Fugu Ultra:東京新創稱調度三大模型媲美 Fable
  4. 4:42Sakana AI 選擇組合模型:資源有限,David Ha 與 Llion Jones 創辦公司
  5. 6:55Transformer 八位作者全離開 Google,John Jumper 也加入人才流動
  6. 8:55Fugu Ultra:7B 指揮官調度 Opus 4.8、GPT 5.5 與 Gemini 3.1 Pro
  7. 11:15指揮官模型用 RL 安排子任務,答案獎勵分為 0、0.5 與 1 分
  8. 13:22可驗證能力進步較快:數學與程式有回饋,網站品味難量化
  9. 15:08駕馭工程能否撐過六個月:Fugu Ultra benchmark 有勝有負
  10. 17:08社群回饋:Fugu Ultra 擅長 code review,但常比 Opus 4.8 更慢更貴
  11. 18:27皮卡丘 Flappy Bird 實測:二十美元用完仍在除錯,畫面不如 Opus 4.8
  12. 19:32主持人看 Sakana AI:Fugu Ultra 未達期待,但模型組合概念會延續

This is a Tier 1 public summary

Whether the chapter key points, section summaries and mind map are public is up to the person who shared it. Want the full analysis?Submit one yourself.

More from this channel

Related analyses