Google Gemini 3.8模型邊思考邊輸出 強化AI決策透明度

商傳媒/[email protected] (商傳媒 SUN MEDIA)
16 小時前

商傳媒|責任編輯/綜合外電報導

Google 近日發布了其最新的人工智慧模型 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,兩者都具有即時語音處理能力,其中「Extended Thinking」技術的應用,讓 AI 模型能邊思考邊輸出,即時揭露其決策過程,試圖提升使用者對 AI 的信任度。

根據《Forkast》報導,Gemini 3.8 Live Extended Thinking 模型在今年九月推出,其核心在於讓 AI 在處理複雜任務時,能以語音方式闡述其思考路徑,例如在背景執行任務時,會先發出「讓我確認一下」等提示。這種視覺化推論(visible inference)的機制,有助於使用者主動監控 AI 的邏輯判斷,並在 AI 產生誤差或誤解指令時及時介入,解決過去 AI 「黑盒子」問題,對於企業導入 AI 應用至關重要。

Gemini 3.8 Live Extended Thinking 在效能方面表現亮眼。《Memeburn》指出,該模型在「Artificial Analysis Speech-to-Speech Quality Index」語音品質指標上獲得 82.6 分,並在「Big Bench Audio」音訊推理測試中達到 97.7% 的成績,於 τ-Voice 的自動化任務(agentic task completion)完成率也達到 68.6%,顯示其在語音處理及自動執行複雜任務方面的優勢。此外,Gemini 模型支援 97 種語言並能無縫切換,且是唯一能原生處理影音內容的業界主流模型。

然而,Google 在其他領域仍面臨競爭。獨立評測顯示,Anthropic 的 Claude Sonnet 4.6 在程式開發評估基準 SWE-bench Verified 上達到 82.1%,大幅領先 Google 舊版 Gemini 3.1 Pro 的 63.8%。雖然 Google 並未公布 Gemini 3.8 系列在程式開發方面的數據,但分析認為 Claude 仍是軟體工程師的首選。在性價比方面,OpenAI 的 GPT-5.6 則被認為表現最佳。

Gemini 3.8 Live 的音訊輸入費用為每分鐘 0.005 美元,音訊輸出則為每分鐘 0.018 美元。Gemini 3.8 Live Extended Thinking 模型已透過 Gemini Live API、Google AI Studio 提供給開發者使用,並整合至 Gmail、Google 文件、Google Keep 等消費性產品中。為確保內容真實性,所有經模型生成的音訊都會嵌入肉眼不可見的 SynthID 浮水印,以防範資訊誤導。包括 Salesforce、Genspark 和 Lumeris 等企業夥伴,以及 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel 和 Vision Agents 等開發者生態系,都正在利用 Gemini Live API 打造客製化的語音代理(voice agent)。