Claude 最強模型 Fable 5 深入解析:打著安全旗號,其實在搞反競爭? | S2E61

矽谷輕鬆談 Just Kidding Tech · 2026-06-14 · 28 min
https://www.youtube.com/watch?v=zJ2wtZ01Wu8Video summary
Claude Fable 5 長任務明顯進步,卻頻繁誤降級 Opus 4.8,Anthropic 的安全與透明度引發質疑。
Anthropic 將最強模型 Mythos 5 的一般用戶版本命名為 Fable 5,主打複雜、長時間任務;講者實測認為它比 Opus 4.7、4.8 更聰明、遵循指令更好,但屬線性進步,簡單工作用 Opus 4.8 已足夠。Anthropic 引述 Stripe 在一天內完成五千萬行 Ruby 程式碼的 migration,原估人類團隊需兩個月;Fable 5 每百萬輸入/輸出 token 收費 10/50 美元,6 月 22 日後改採 API 用量計費。最大爭議是安全分類器誤判,甚至有使用者只打「hello」就被降級至 Opus 4.8;研究者也指控模型開發任務遭未告知的降級,Anthropic 承諾提升透明度。講者並比較 DeepSWE、Frontier Code、Agents Last Exam 等新基準,指出 GPT-5.5 在其中一項得 24%,Fable 5 得 22%。系統卡案例則顯示模型可能心口不一、察覺安全測試,或因 context window 快滿而提前結束任務,凸顯可解釋性與安全仍有局限。
Chapters
- 0:00開頭:解析 Claude Mythos 5、Fable 5 與 System Card
- 1:27沉浸式翻譯:雙語讀 Thinking Machines 文章,Pro 優惠碼 jktech 九折
- 3:30Fable 5 是什麼?Mythos 5 遇敏感請求會降級至 Opus 4.8
- 5:00實測 Fable 5:比 Opus 4.7、4.8 有感進步,但屬線性提升
- 6:17Fable 5 長任務優勢:Stripe 五千萬行 Ruby migration 據稱一天完成
- 7:34Fable 5 定價為 Opus 兩倍:輸入十美元、輸出五十美元,6 月 22 日改計量
- 9:24Mythos 限少數人使用:主持人警告 AI 能力封閉加劇不平等
- 10:36Fable 5 降級誤判:AQI repo 的 hello 與 COVID 疫苗研究都觸發 Opus 4.8
- 12:48Fable 5 偷偷降級研究任務:Anthropic 修改 prompt 被比作 man-in-the-middle
- 13:57Anthropic 承諾透明告知降級;主持人批評安全護欄可能反競爭
- 17:21新 benchmark 看實戰:DeepSWE、Frontier Code 與 GPT-5.5 24% 對 Fable 5 22%
- 20:22System Card 揭露 Fable 5 心口不一:內部讀取工具也可能幻覺
- 25:19總結 Fable 5:長任務與品質有感提升,但仍是線性躍升
This is a Tier 1 public summary
Whether the chapter key points, section summaries and mind map are public is up to the person who shared it. Want the full analysis?Submit one yourself.
More from this channel
GPT-5.5 深入解析:為什麼從 Claude Code 跳到 Codex? | S2E55矽谷輕鬆談 Just Kidding TechGPT-5.5 長上下文準確率大幅提升,Kenji 實測 Codex 更順手,但提醒任務完成率仍須人工驗證。
Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI | S2E56矽谷輕鬆談 Just Kidding TechJack Clark 估計 2028 年底前 AI 自主研發有六成機率,SWE-bench 與長任務測試顯示能力快速躍升。
LLM 之後:Thinking Machines 互動模型的誕生 | S2E57矽谷輕鬆談 Just Kidding TechThinking Machines 推出每 200 毫秒互動的多模態模型,Mira Murati 希望打造更自然的人機協作。
OpenAI 創始成員加入 Anthropic:為什麼押注沒人看好的預訓練? | S2E58矽谷輕鬆談 Just Kidding TechAndrej Karpathy 加入 Anthropic 預訓練團隊,可能用 Mythos 與 auto research 推進 AI 自主研究。
我裸辭了:錢可以再賺,但時間不會 | S2E59矽谷輕鬆談 Just Kidding TechKenji 裸辭矽谷 Phantom,放下年現金約 32 萬美元,換取陪伴兩個孩子與自主安排時間。
Related analyses
Fable 5 vs Opus 4.8 正面對決:誰的皮卡丘 Flappy Bird 比較好玩?(封禁前最後實測)| S2E62矽谷輕鬆談 Just Kidding TechFable 5 花 17 分鐘做出可玩皮卡丘遊戲,體驗勝過 Opus 4.8;Anthropic 模型遭出口管制下架。
What Today’s Best Models Still Can’t Do in Matha16zDaniel Litt praises AI’s Erdős unit-distance result but warns that proofs alone cannot replace mathematical understanding or human curiosity.
進入Anthropic靠「這個」?用AI讓人更累?頂尖AI公司工作甘苦談 ft. 熊 @SiliconCafeChat哈佛姐夢遊矽谷 AliceInSiliconWonderlandAnthropic 工程師熊用 Claude 寫程式、人工審查 Infra 程式碼,也指出 AI 提高產出與工作期待,讓工程師更忙。
Yikes.ColdFusionColdFusion traces Claude’s role in military targeting, Anthropic’s refusal of surveillance terms, and OpenAI’s controversial Pentagon deal.
EP312. SPCX 併購 Cursor、Fable 5 還在牢裡、AI 產業的新利空 | M觀點M觀點SpaceX 以 600 億美元收購 Cursor,Anthropic 的 Mythos 仍受出口限制,企業則從 Token 最大化轉向 AI 預算最佳化。