Share:

Video summary

Thinking Machines 推出每 200 毫秒互動的多模態模型,Mira Murati 希望打造更自然的人機協作。

Thinking Machines 發表互動模型研究預覽版,將音訊、影像與文字原生納入訓練,能邊聽邊說、同時接收新資訊,還可在背景搜尋後即時把結果融入對話。模型以每 200 毫秒為微回合持續推論,將時間與沉默納入上下文;相較 GPT-4o、Gemini 等回合式系統,不必等使用者說完才回應,但基準測試顯示它互動性突出,智慧與準確度並非全面領先。影片也回顧創辦人 Mira Murati 離開 OpenAI、創立公司的經歷,以及公司種子輪募得 20 億美元、估值達 120 億美元。作者認為,六名共同創辦人已有三人離開,加上產品化、算力、安全與長上下文仍是挑戰,這次 demo 也有爭取投資人與人才信心的考量;若技術成熟,未來半年至一年其他模型商也可能跟進。

Chapters

  1. 0:00開頭:Thinking Machines 推出可即時交流的多模態互動模型
  2. 3:06Demo 一:模型可重疊對話、翻譯印度語並記住 friend 指令
  3. 5:48Demo 搜尋幾秒即融入對話;人體聽覺反應比視覺快
  4. 6:55Blog 開講:從零訓練原生互動模型,改善等待 Claude Code 的合作體驗
  5. 8:08200 毫秒一回合:micro turn 讓模型持續接收輸入
  6. 10:00Demo 二:AI 即時把粗話改成 HR 專業語言,並以沉默保留時間脈絡
  7. 14:25兩個模型在背後跑:互動模型對話、背景模型搜尋與呼叫工具
  8. 16:562023 年 OpenAI 政變:Mira 提供管理回饋、短暫任代理 CEO,後支持 Sam 回任
  9. 21:32Thinking Machines 成立後獲 A16Z 領投 20 億美元,估值達 120 億美元
  10. 23:18互動模型的時間感:200 毫秒串流微回合納入訓練
  11. 25:02模型三代差異:從語音轉文字到原生邊聽邊說
  12. 27:21Harness engineering 的宿命:模型變強後,既有工具可能得重做
  13. 29:12Benchmark:TML interaction small 互動領先,GPT realtime 2.0 xhigh 準確度較佳
  14. 31:28為什麼是現在?Thinking Machines 三位創辦人離開,靠互動模型 demo 挽回信心

This is a Tier 1 public summary

Whether the chapter key points, section summaries and mind map are public is up to the person who shared it. Want the full analysis?Submit one yourself.

More from this channel

Related analyses