GPT RealTime 2登場:語音助手進化為真正的思維協作夥伴

2026-08-02 · 0 次瀏覽 AI

摘要

OpenAI發布GPT RealTime 2,將GPT-5級別推理能力整合至語音模型,使語音助手能在對話中進行邏輯推理與深度分析。新模型具備情緒感知與音調調節功能,並搭配實時翻譯與實時轉寫工具。語音交互正式從被動命令執行升級為主動代理模式,重新定義人機互動方式。

完整逐字稿
OpenAI把槍口對準了語音交互領域。GPT RealTime 2正式亮相,這次將GPT-5級別推理能力注入音頻模型。語音助手不再只是聽指令辦事的複讀機,而是能在對話中提論推理,給出有邏輯深度的回應。

讓語音交互從簡單的命令執行升級為真正的思維協作。它的推理強度可調節,在較高設定下能處理邏輯謎題、戰略決策和空間感之類的任務。

一位創作者隨口描述了自己在火車站旁開咖啡館的構想。模型沒有盲目鼓勵,而是逐條分析了租金與客流週期不匹配的風險,並建議先用攤車驗證最小可行產品。這種分析深度以往只能在文字對話中實現,現在通過語音交互就能完成。

情緒感知和音調控制同樣值得留意。他們根據用戶的情緒狀態調整語氣,沮喪時用輕柔的聲音回應,任務完成時語氣會變得輕快。為避免沉默等待的尷尬,它會在思考前自動加上一句過渡語,讓對話節奏保持流暢。

同時發佈的還有實時翻譯和實時轉寫兩款配套工具。實時翻譯保留說話者的情緒起伏,實時轉寫在用戶說話同時輸出文本,適用於會議記錄和字幕生成等場景。

OpenAI將語音交互從被動模式推進到代理模式。用戶可以在口頭提出複雜需求,AI在後台一邊對話一邊調取工具並完成任務,整個過程都非常連貫。當推理能力與實時語音相融合,人機交互的方式正在被重新定義。