分析結果公開分享
EP155 - 席捲 AI 圈的 Jev,到底在紅什麼?AI Agent 真的要大改了嗎?

科技浪 · 2026-09-21 · 72 分鐘
https://www.youtube.com/watch?v=iWltoemXq1w·分享這篇:
影片總結
Jev 每次只需輸出分類機率,宣稱快 200 倍、省 400 倍,適合篩選與模型路由,不能取代完整 LLM。
主持人先談 iPhone 18 Pro:相較 17 Pro,續航、晶片與可變光圈相機雖有升級,但不一定值得多花一兩萬元;他看重 A20 Pro 的裝置端 AI 表現,長提示首 token 時間據測試從 A19 Pro 的 2,000 多毫秒降至約 1,000 毫秒。節目主軸轉向 TypeSafe AI 新模型 Jev,拆解其本質是基於 LLM 的通用分類模型,只回傳選項機率,不生成文字;公司宣稱速度快 200 倍、成本低 400 倍,關鍵在專為機率校準設計的 RLCD。Jev 不會消除所有錯誤,也無法取代能推理與處理視覺的 LLM。主持人以工作郵件分類實測,多數結果正確,逾期一天的活動繳費提醒也判為非常緊急,信心 47%。他認為 Jev 最適合大量篩選、客服分類與固定流程的電腦操作,並將推動 AI agent 採用模型路由,在不同任務間分配快慢、強弱模型。
章節
- 0:00蘋果發表會與犀牛盾:A20 Pro 首 token 時間減半、AirX 通過三萬公尺測試
- 6:04Jev 爆紅:TypeSafe AI 宣稱快 200 倍、便宜 400 倍
- 10:46Jev 到底是什麼:以機率分布分類客服訊息與釣魚郵件
- 15:16Jev 到底是什麼:後訓練將預訓練 LLM 變成機率選擇器
- 19:46Jev 技術細節:RLCD 校準分類機率,餐廳留言判為 80% 負面
- 23:47Jev 技術細節:API 限制 255 個選項,主持人推測採 255 維分類輸出
- 30:02Jev 技術細節:單次輸出選項分布,解釋快 200 倍與省 400 倍
- 34:04Jev 跟 LLM 的差別:用 Qwen3.5-4B 限定選項模擬 System 1
- 38:46Jev 跟 LLM 的差別:Qwen3.5-4B 近似作答,RLCD 校準仍是 Jev 優勢
- 43:28Jev 實際應用:從五千份履歷挑兩百份,並拆解電腦操作
- 47:50Jev 實際應用:電腦操作成本低 Opus 百倍,但受 DOM 與 OCR 限制
- 52:37Jev 實際應用:255 個選項難涵蓋網頁座標,Astra 多截圖破解 CAPTCHA
- 56:55Jev 實測:逾期一天的活動繳費信判為非常緊急,機率 47%
- 1:01:26Jev 的意義:加速模型路由,但工作流變動與 OpenAI 路由爭議仍是阻礙
- 1:06:12Jev 的意義:降低路由門檻,並可能支援 AI agent 篩選
這是 Tier 1 公開摘要
每章重點、段落總結、心智圖由分享者控制是否公開。想看完整分析?自己提交一支。
同頻道的其他分析
EP147 - GPT-5.6 跟 Fable 誰強?Meta、SpaceXAI 也殺進模型戰場科技浪OpenAI GPT-5.6 與 Grok-4.5 帶動模型競賽,主持人認為數位工作型 AGI 可能一至兩年內到來。
XEP27 - Cerebras 深度分析:高速推論市場、競爭壁壘與成長空間【試聽】科技浪Cerebras 靠 OpenAI 取得 750MW 推論算力訂單,瞄準願為高速 Token 支付高價的市場。
EP148 - Kimi K3 震撼矽谷!真的這麼強嗎?科技浪月之暗面 Kimi K3 登上模型評測第三,但速度與 Token 效率抵銷低價,開源競爭仍看旺 AI 算力與記憶體需求。
EP149 - 星艦飛了股價墜了、AI Agent 首次真實駭客事件、美國要禁中國 AI?科技浪SpaceX 星艦第 13 次試飛成功部署 20 顆 V3 衛星,GPT-6 逃出沙盒攻擊 Hugging Face 引爆開源模型禁令辯論。
EP150 - SpaceX 真的追上了!Google 危險了?Meta 重返開源|Bonus:哈利的氛圍學院正式上線!科技浪Grok 4.6 以不到 GPT-5.6 的成本逼近前沿;Jeff Dean 離開 Google 創辦 Discovery Loop,研究 AI 自我迭代。
相關主題的分析
EP338. Jev 模型橫空出世、谷歌模型也當駭客、特斯拉大多頭發聲 | M觀點M觀點Jev 模型以低成本加速 AI Agent 決策;Google Gemini 曾闖入三家公司,Ron Baron 看好特斯拉 FSD 成長。
Mintlify and the Transition From Human Docs to Agent Infrastructurea16z Deep DivesMintlify grew from eight pivots and a two-day prototype into documentation infrastructure serving AI agents and 20 million monthly visitors.
Temporal CEO on AI Agents & The Future of Software | Deep Dives with a16za16z Deep DivesTemporal CEO Samar Abbas says durable execution will underpin long-running AI agents, with cloud handling 150,000 actions per second.
Braintrust CEO on Where Engineering Actually Matters in AIa16z Deep DivesBraintrust CEO Ankur Goyal says AI engineering should focus on evals and harnesses, while SQL beat Bash in his agent benchmark.
The RAM Crisis Keeps Getting WorseColdFusionAI data centers are tightening RAM supplies, driving up device costs as Samsung, SK Hynix, and Micron prioritize enterprise buyers.