AnalysisPublic share
Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI | S2E56

矽谷輕鬆談 Just Kidding Tech · 2026-05-10 · 21 min
https://www.youtube.com/watch?v=2ESCD6jtACw·Share:
Video summary
Jack Clark 估計 2028 年底前 AI 自主研發有六成機率,SWE-bench 與長任務測試顯示能力快速躍升。
Anthropic 共同創辦人、政策負責人 Jack Clark 預測,2028 年底前 AI 自主研發下一代 AI 的機率為 60%。他引用 SWE-bench 數據:Claude 2 在 2023 年解題率僅 2%,未發布的 Claude Mythos 達 93.9%;METR 長任務測試則從 GPT-3.5 的 36 秒,進步到 Opus 4.6 的 12 小時,研究者預估年底可能出現可執行 100 小時任務的模型。研究能力也快速成長,Opus 在 Core-Bench 最難任務的分數從 GPT-4o 的 21.5% 升至 95.5%;Anthropic 內部測試中,Mythos 將小型語言模型程式碼優化 52 倍。討論同時指出,AI 仍可能缺乏創意,且有對齊、假裝完成與錯誤複利等風險;能否可靠監督超越人類能力的模型仍是未解問題。
Chapters
- 0:00開頭:Jack Clark 預測 2028 年底前 AI 有 60% 機率自動化研發
- 2:15Jack Clark 是誰?Anthropic 政策負責人以研究估計 2028 年 AI 自主研發機率 60%
- 4:28第一個理由:Claude 2 的 SWE-bench 2% 升至 Claude Mythos 93.9%
- 6:16從 36 秒到 12 小時:METR 指標顯示 Opus 4.6 長任務能力躍升
- 8:13外插一下:從年底 100 小時推估 2027 年 40 天、再後一年 400 天
- 9:15第二個理由:Core-Bench 從 21.5% 升至 95.5%,Mythos 優化程式碼 52 倍
- 11:38AI 研究像組樂高?Transformer 自 2017 年以 scaling law 持續延伸
- 12:47AlphaGo 第 37 手:人類落子機率不到萬分之一,並引出 AI 對齊風險
- 15:31複利錯誤:99.9% 準確度迭代 500 代後降至 60%,Anthropic 測試 AI 對齊
- 16:39當 AI 比人聰明:十萬行程式碼難審,模型也可能假裝通過對齊測試
- 18:11預測對錯不重要:從 Jack Clark 的數據推導學習,持續更新 AI 核心技能
This is a Tier 1 public summary
Whether the chapter key points, section summaries and mind map are public is up to the person who shared it. Want the full analysis?Submit one yourself.
More from this channel
GPT-5.5 深入解析:為什麼從 Claude Code 跳到 Codex? | S2E55矽谷輕鬆談 Just Kidding TechGPT-5.5 長上下文準確率大幅提升,Kenji 實測 Codex 更順手,但提醒任務完成率仍須人工驗證。
LLM 之後:Thinking Machines 互動模型的誕生 | S2E57矽谷輕鬆談 Just Kidding TechThinking Machines 推出每 200 毫秒互動的多模態模型,Mira Murati 希望打造更自然的人機協作。
OpenAI 創始成員加入 Anthropic:為什麼押注沒人看好的預訓練? | S2E58矽谷輕鬆談 Just Kidding TechAndrej Karpathy 加入 Anthropic 預訓練團隊,可能用 Mythos 與 auto research 推進 AI 自主研究。
我裸辭了:錢可以再賺,但時間不會 | S2E59矽谷輕鬆談 Just Kidding TechKenji 裸辭矽谷 Phantom,放下年現金約 32 萬美元,換取陪伴兩個孩子與自主安排時間。
AI 生產力的幻覺:從開發者到整個產業的自我感覺良好 | S2E60矽谷輕鬆談 Just Kidding TechMETR 實驗發現開發者用 AI 實際慢 19%,影片也提醒 Junior 可能因缺少訓練而出現能力斷層。
Related analyses
EP154 - AI 真的解決了數學世紀難題嗎?Anthropic 員工開始警告末日科技浪OpenAI 宣稱 AI 破解 Navier-Stokes 難題,耗費上千萬美元引發署名爭議;陶哲軒警告 AI 可能削弱數學訓練。
Mintlify and the Transition From Human Docs to Agent Infrastructurea16z Deep DivesMintlify grew from eight pivots and a two-day prototype into documentation infrastructure serving AI agents and 20 million monthly visitors.
Yikes.ColdFusionColdFusion traces Claude’s role in military targeting, Anthropic’s refusal of surveillance terms, and OpenAI’s controversial Pentagon deal.
Claude Cowork 最友善的手把手教學!你還在叫 AI 幫你想答案?但高手們都已經在用 AI 交成品了 ~PAPAYA 電腦教室Claude Cowork 每月 20 美元起,可整理檔案、製作課程教材,還能遠端操作軟體與安排排程。
OpenAI Kills Sora then Descends into ChaosColdFusionOpenAI shut down Sora after costs reached $15 million a day, while raising $122 billion and reportedly buying TBPN.