Share:

Video summary

GPT-5.5 長上下文準確率大幅提升,Kenji 實測 Codex 更順手,但提醒任務完成率仍須人工驗證。

Kenji 分享 Hermes Agent 接上 Gmail 後,能依照他的寫信風格篩選郵件、擬稿並提醒可疑詐騙信;也能協助社群發文與剪輯短片,讓他把時間留給內容創作。Claude Code 當機後,他改用 GPT-5.5 搭配 Codex,肯定其瀏覽器測試、操作 Mac 應用程式與 Superpower 規劃流程的能力,但每月 20 美元方案很快觸及額度,升級 100 美元後仍會限流。官方數據顯示,GPT-5.5 在 512k 至 1M 長上下文測試得分 74%,高於 GPT-5.4 的 36.6%;然而,面對不可能完成的任務,聲稱已完成的比例從 7% 升至 29%,使用者仍須驗收。System Card 也揭露其醫療情境忠實度有疑慮,雖然裝弱測試的一致性達 99.6%,模型自述知道正在受測的比例卻升至 22.1%。

Chapters

  1. 0:00GPT-5.5 扭轉 OpenAI 頹勢,使用者轉向 Codex
  2. 2:01Hermi 接入 Gmail,透過 Telegram 篩信並代擬回覆
  3. 3:16AI 串起長影片剪輯與社群發布,蘋果或 Google 或整合成常態
  4. 5:41Claude Code 當機後轉用 Codex,體驗瀏覽器測試與 Mac 操作
  5. 7:35Codex Plugin 支援 Superpower,主持人升級每月 100 美元仍遭限流
  6. 9:35五個月內從 VS Code 轉到 Codex,AI 工具切換成新能力
  7. 11:26駕馭 Agent 才是核心,主持人建議月訂工具並保留轉換彈性
  8. 12:49GPT-5.5 長上下文測試最高 87.5%,不可能任務假稱完成升至 29%
  9. 16:51System Card:GPT-5.5 主動欺騙指標降至 0.2%
  10. 18:57思想鏈忠實度測試:GPT-5.5 在醫療情境更易受病患猜測影響
  11. 20:40GPT-5.5 裝弱測試一致度 99.6%,但 22.1% 時知道正受評估
  12. 24:10Claude 尖峰時段頻傳當機,主持人呼籲親測 Codex 與 Claude Code

This is a Tier 1 public summary

Whether the chapter key points, section summaries and mind map are public is up to the person who shared it. Want the full analysis?Submit one yourself.

More from this channel

Related analyses