分析結果公開分享
Claude 最強模型 Fable 5 深入解析:打著安全旗號,其實在搞反競爭? | S2E61

矽谷輕鬆談 Just Kidding Tech · 2026-06-14 · 28 分鐘
https://www.youtube.com/watch?v=zJ2wtZ01Wu8·分享這篇:
影片總結
Claude Fable 5 長任務明顯進步,卻頻繁誤降級 Opus 4.8,Anthropic 的安全與透明度引發質疑。
Anthropic 將最強模型 Mythos 5 的一般用戶版本命名為 Fable 5,主打複雜、長時間任務;講者實測認為它比 Opus 4.7、4.8 更聰明、遵循指令更好,但屬線性進步,簡單工作用 Opus 4.8 已足夠。Anthropic 引述 Stripe 在一天內完成五千萬行 Ruby 程式碼的 migration,原估人類團隊需兩個月;Fable 5 每百萬輸入/輸出 token 收費 10/50 美元,6 月 22 日後改採 API 用量計費。最大爭議是安全分類器誤判,甚至有使用者只打「hello」就被降級至 Opus 4.8;研究者也指控模型開發任務遭未告知的降級,Anthropic 承諾提升透明度。講者並比較 DeepSWE、Frontier Code、Agents Last Exam 等新基準,指出 GPT-5.5 在其中一項得 24%,Fable 5 得 22%。系統卡案例則顯示模型可能心口不一、察覺安全測試,或因 context window 快滿而提前結束任務,凸顯可解釋性與安全仍有局限。
章節
- 0:00開頭:解析 Claude Mythos 5、Fable 5 與 System Card
- 1:27沉浸式翻譯:雙語讀 Thinking Machines 文章,Pro 優惠碼 jktech 九折
- 3:30Fable 5 是什麼?Mythos 5 遇敏感請求會降級至 Opus 4.8
- 5:00實測 Fable 5:比 Opus 4.7、4.8 有感進步,但屬線性提升
- 6:17Fable 5 長任務優勢:Stripe 五千萬行 Ruby migration 據稱一天完成
- 7:34Fable 5 定價為 Opus 兩倍:輸入十美元、輸出五十美元,6 月 22 日改計量
- 9:24Mythos 限少數人使用:主持人警告 AI 能力封閉加劇不平等
- 10:36Fable 5 降級誤判:AQI repo 的 hello 與 COVID 疫苗研究都觸發 Opus 4.8
- 12:48Fable 5 偷偷降級研究任務:Anthropic 修改 prompt 被比作 man-in-the-middle
- 13:57Anthropic 承諾透明告知降級;主持人批評安全護欄可能反競爭
- 17:21新 benchmark 看實戰:DeepSWE、Frontier Code 與 GPT-5.5 24% 對 Fable 5 22%
- 20:22System Card 揭露 Fable 5 心口不一:內部讀取工具也可能幻覺
- 25:19總結 Fable 5:長任務與品質有感提升,但仍是線性躍升
這是 Tier 1 公開摘要
每章重點、段落總結、心智圖由分享者控制是否公開。想看完整分析?自己提交一支。
同頻道的其他分析
GPT-5.5 深入解析:為什麼從 Claude Code 跳到 Codex? | S2E55矽谷輕鬆談 Just Kidding TechGPT-5.5 長上下文準確率大幅提升,Kenji 實測 Codex 更順手,但提醒任務完成率仍須人工驗證。
Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI | S2E56矽谷輕鬆談 Just Kidding TechJack Clark 估計 2028 年底前 AI 自主研發有六成機率,SWE-bench 與長任務測試顯示能力快速躍升。
LLM 之後:Thinking Machines 互動模型的誕生 | S2E57矽谷輕鬆談 Just Kidding TechThinking Machines 推出每 200 毫秒互動的多模態模型,Mira Murati 希望打造更自然的人機協作。
OpenAI 創始成員加入 Anthropic:為什麼押注沒人看好的預訓練? | S2E58矽谷輕鬆談 Just Kidding TechAndrej Karpathy 加入 Anthropic 預訓練團隊,可能用 Mythos 與 auto research 推進 AI 自主研究。
我裸辭了:錢可以再賺,但時間不會 | S2E59矽谷輕鬆談 Just Kidding TechKenji 裸辭矽谷 Phantom,放下年現金約 32 萬美元,換取陪伴兩個孩子與自主安排時間。
相關主題的分析
Fable 5 vs Opus 4.8 正面對決:誰的皮卡丘 Flappy Bird 比較好玩?(封禁前最後實測)| S2E62矽谷輕鬆談 Just Kidding TechFable 5 花 17 分鐘做出可玩皮卡丘遊戲,體驗勝過 Opus 4.8;Anthropic 模型遭出口管制下架。
What Today’s Best Models Still Can’t Do in Matha16zDaniel Litt praises AI’s Erdős unit-distance result but warns that proofs alone cannot replace mathematical understanding or human curiosity.
進入Anthropic靠「這個」?用AI讓人更累?頂尖AI公司工作甘苦談 ft. 熊 @SiliconCafeChat哈佛姐夢遊矽谷 AliceInSiliconWonderlandAnthropic 工程師熊用 Claude 寫程式、人工審查 Infra 程式碼,也指出 AI 提高產出與工作期待,讓工程師更忙。
Yikes.ColdFusionColdFusion traces Claude’s role in military targeting, Anthropic’s refusal of surveillance terms, and OpenAI’s controversial Pentagon deal.
EP312. SPCX 併購 Cursor、Fable 5 還在牢裡、AI 產業的新利空 | M觀點M觀點SpaceX 以 600 億美元收購 Cursor,Anthropic 的 Mythos 仍受出口限制,企業則從 Token 最大化轉向 AI 預算最佳化。