OpenAI Bidi 1 是什麼?全雙工語音模型能力與發布預測
6 月 23 日,社群帳號 testingcatalog 在 X 上公開一批未經 OpenAI 官方證實的測試紀錄,稱 OpenAI 正開發代號「Bidi 1」的雙向語音模型,能在使用者說話時同步回應,而非等待對方停頓才處理。

6 月 23 日,社群帳號 testingcatalog 在 X 上公開一批未經 OpenAI 官方證實的測試紀錄,稱 OpenAI 正開發代號「Bidi 1」的雙向語音模型,能在使用者說話時同步回應,而非等待對方停頓才處理。若爆料屬實,這意味著 ChatGPT 語音互動可能從現行的半雙工(half-duplex)輪流應答,往全雙工(full-duplex)方向推進。
根據 testingcatalog 的描述,Bidi 1 能在使用者話還沒說完時開口回應,同時持續接收輸入;模型能在句子說到一半時切換任務、接受打斷,並在對方說話期間持續累積上下文記憶。測試中,爆料方記錄到 Bidi 1 能不停頓地從 1 連數到 23,持續發話的時間上限目前仍存在,testingcatalog 表示這在現階段屬預期內。至於部署時程,Bidi 1 預計整合進 ChatGPT,也可能進入 Codex,testingcatalog 形容時間「非常、非常快」,但未給出具體日期。
現行語音 AI 大多採半雙工模式,一方說完另一方才處理,快速打斷、即時訂正、多輪來回這類場景的體驗因此明顯受限。Bidi 1 爆料描述的全雙工能力,如果最終在 ChatGPT 語音介面落地,理論上會讓對話節奏更接近真人通話;對打算在語音介面上部署 AI Agent 的開發者而言,這意味著模型處理打斷、任務切換與上下文維持的能力上限有機會整體拉高,語音驅動的應用場景可能也隨之擴展。不過,所有能力描述目前均來自單一爆料帳號,OpenAI 尚未公開回應,Bidi 1 也尚未正式發布,在官方說法出現前,這批資訊仍應以未經查證的爆料看待。
標籤


