Capture record
- Canonical URI: https://www.bnext.com.tw/article/92265/google-gemini-3-8-live-extended-thinking-launch
- Source class: secondary synthesis。BusinessNext(李先泰)整理 Google 2026-09-15 發布的 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,並引用 Google 官方部落格、Gemini API pricing 與模型文件。本文保留媒體整理、供應商產品定位與 benchmark attribution,不把單一模型宣稱升格為 AI Ark 的通用品質、成本或可靠性結論;維持
status: draft。 - 原文標題: 語音AI新霸主?Google推出Gemini 3.8 Live雙模型,實測奪冠還能「邊聊邊做事」
- 作者/出版者: 李先泰/數位時代 BusinessNext
- 發布/修改時間: 2026-09-16T11:50:00+08:00(BusinessNext
NewsArticleJSON-LD) - 擷取時間: 2026-09-16T05:41:21+00:00
- Retrieval method: BusinessNext、Google 官方部落格、Google AI for Developers pricing 與兩個模型文件先以
web_extract讀取,再以 Pythonurllib直接 HTTP GET 核對 canonical status、response headers 與 bytes。全程未使用 browser;只保存 metadata、faithful summary、claim ledger、必要來源連結與 rights boundary,不保存文章、HTML、圖片、影片或模型 payload。 - HTTP metadata: BusinessNext status
200;responseDate: Wed, 16 Sep 2026 05:32:14 GMT;直接 HTTP response 381,411 bytes;JSON-LD 為NewsArticle。Google 官方部落格 status200、responseDate: Wed, 16 Sep 2026 05:32:14 GMT、427,841 bytes;Gemini API pricing status200、responseDate: Wed, 16 Sep 2026 05:32:15 GMT、242,838 bytes;Gemini 3.8 Live 模型文件 status200、responseDate: Wed, 16 Sep 2026 05:32:16 GMT、105,655 bytes;Extended Thinking 模型文件 status200、responseDate: Wed, 16 Sep 2026 05:40:29 GMT、106,026 bytes。 - Saved payloads and SHA-256: 無;只保存本 wrapper。frontmatter 的
sha256是本檔 frontmatter 結束後 body 的 SHA-256,未對未保存的 HTML、圖片、影片、benchmark payload 或模型 payload 宣稱可重現 hash。
Faithful summary
BusinessNext 報導 Google 於美國時間 2026-09-15 發表 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking。Google 官方部落格將前者定位為面向規模與成本效率、具流暢對話與 visual grounding 的 live model;後者定位為高複雜度任務與多步推理。兩者共同被描述為近即時語音對話模型,可處理視覺輸入、在對話不中斷時背景執行工具與 API 呼叫;官方模型文件另列出 text/image/audio/video 輸入、text 與 audio 輸出,以及 131,072 input/65,536 output token limits。1234
Gemini 3.8 Live Extended Thinking 的差異化敘述是「推理與說話同時進行」:模型可先以口語回應確認,再在背景進行多步推理、非同步工具呼叫與進度回報。Extended Thinking 模型文件將其標為高推理 audio-to-audio model,function calling 為 async only;一般 Live 模型文件則說明非同步 function calling 為預設模式,並支援 Live API、thinking(interleaved reasoning)與 search grounding。這些是官方產品行為與整合條件,未由本輪執行 API 實測。234
Google 官方部落格列出 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech to Speech Quality Index 得分 82.6、τ-Voice 68.6%、Sierra τ-Voice-banking 35.1% 與 Big Bench Audio 97.7%;Gemini 3.8 Live 則被描述為在 Speech Agent Arena 取得第二名。Google 也提到 ServiceNow EVA-Bench 的準確度與對話品質 Pareto frontier,但未在公告提供完整數字。這些數字與排名是供應商引用的特定 benchmark 或平台結果,評測切分、harness、baseline、成本分母、統計不確定性與外部重現未在本筆取得。21
Gemini API pricing 頁面將兩款 Live 模型列在同一 pricing section:付費方案下,文字輸入/輸出為每百萬 token 0.75/4.50 美元,音訊輸入為 3.00 美元或 0.005 美元/分鐘,音訊輸出為 12.00 美元或 0.018 美元/分鐘;免費層列為免費,但內容可用於改善產品,付費層則列為不使用於改善產品。價格、計費口徑、方案與 rollout 可能變動,單價不等於每任務成本。51
發布路徑方面,Google 表示兩款模型自 2026-09-15 起陸續推出:開發者可在 Gemini API 與 Google AI Studio 使用;企業端為 Gemini Enterprise private preview;一般使用者則分別進入 Search Live、Gemini Live,以及受訂閱方案限制的 Workspace 語音情境。官方部落格另稱所有由 AI 產品生成的音訊都嵌入 SynthID watermark。這些是供應商的產品入口、合作與 provenance 宣告,不代表在所有帳號、地區、介面或企業租戶已同時可用。21
Primary-source checks during ingest
以下頁面在本次 ingest 中實際讀取,作為 claim tracing 參考;未另存完整 response payload:
- BusinessNext 92265:支持本文標題、作者、發布/修改時間、正文與媒體整理範圍;來源分類為 secondary synthesis。
- Google:Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking:支持模型定位、近即時視覺、97 語言、背景工具執行、同時推理與說話、benchmark/排名、rollout 與 SynthID 敘述。
- Gemini Developer API pricing:支持文字/音訊 token 與分鐘計價、免費/付費資料使用說明;價格可能變動。
- Gemini 3.8 Live model documentation:支持 stable model code、輸入/輸出型態、token limits、Live API、thinking、search grounding 與 asynchronous function calling 條件。
- Gemini 3.8 Live Extended Thinking model documentation:支持高推理 audio-to-audio 定位、stable model code、token limits、async-only function calling 與 background reasoning 敘述。
Claim ledger
| ID | Source claim | Status | Owning evidence and boundary |
|---|---|---|---|
| C01 | BusinessNext 92265 報導 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 發布,作者為李先泰,發布/修改時間為 2026-09-16T11:50:00+08:00。 | supported | BusinessNext JSON-LD 與正文直接支持;只代表文章 metadata 與報導內容。 |
| C02 | Gemini 3.8 Live 主打規模與成本效率、visual grounding;Extended Thinking 主打高複雜度任務與多步推理。 | supported | Google 官方發布頁直接支持供應商產品定位;不等於跨任務品質或 ROI 優勢。 |
| C03 | 兩款模型能處理視覺輸入、在對話不中斷時背景執行工具/API,並支援近即時語音對話。 | supported | Google 官方發布頁與模型文件支持能力描述;本輪未做實際 latency、tool success 或 failure-rate 測量。 |
| C04 | Extended Thinking 可在串流語音期間進行 background reasoning,並以非同步工具呼叫維持連續對話;模型文件將 function calling 列為 async only。 | supported | Google 官方發布頁與 Extended Thinking 模型文件支持產品行為描述;未以 API harness 重現狀態轉換或中斷條件。 |
| C05 | Extended Thinking 在 Artificial Analysis Speech to Speech Quality Index 得分 82.6、τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%;Live 在 Speech Agent Arena 第二名。 | partially-supported | Google 官方部落格與 BNext 直接列出數字/排名;benchmark protocol、baseline、資料切分、成本與外部重現未取得,不作通用 SOTA 結論。 |
| C06 | 兩款模型付費方案的文字輸入/輸出為 0.75/4.50 美元每百萬 token,音訊輸入/輸出為 3.00/12.00 美元每百萬 token,並提供每分鐘等價價格。 | supported | Google API pricing 頁直接支持當期價目表;價格、地區、方案、計費與 future change 可能不同,單價不等於 task-level cost。 |
| C07 | 開發者可於 Gemini API/Google AI Studio 使用,企業端為 private preview,一般使用者入口包含 Search Live、Gemini Live 與訂閱限制的 Workspace 情境。 | supported | Google 官方發布頁直接支持 rollout 敘述;不代表所有帳號、地區、介面與租戶均已可用。 |
| C08 | 所有 AI 生成音訊均嵌入 SynthID watermark。 | supported | Google 官方發布頁直接支持 provider policy/provenance 宣告;本輪未獨立測試 watermark 偵測率、抗攻擊性或跨產品覆蓋。 |
| C09 | Gemini 3.8 Live/Extended Thinking 在 AI Ark 現有任務、provider、harness 與部署環境中一定優於既有 Gemini 3.8 Flash、Gemini 3.7 Flash 或其他語音模型。 | unresolved | 本輪未執行固定 task distribution、工具回合、延遲、錯誤率、輸出 token、人工 review 與完整任務成本的對照測試。 |
| C10 | 「語音 AI 新霸主」或官方 benchmark 排名可直接推出一般企業導入的品質、可靠性、安全性或 ROI 優勢。 | unresolved | 缺少跨環境與 production protocol;標題與供應商 benchmark 不足以支持通用商業結論。 |
Evidence boundary
截至 2026-09-16 UTC,本筆能支持的最小結論是:BusinessNext 92265 提供 Gemini 3.8 Live 雙模型的二手發布整理,Google 官方部落格、pricing 與模型文件可核對兩款模型的定位、即時語音/視覺/背景工具行為、部分 benchmark 數字、API 定價、模型識別與 rollout 邊界。可重用的 AI Ark 判準是把 model + streaming/tool behavior + task distribution + harness + latency + full task cost + account/release tier 一起評估;token 單價、語音分鐘價與單一 benchmark 排名都不能替代任務級驗證。
本記錄不能證明兩款 Live 模型在所有 voice-agent、customer-service、browser/tool workflow 或 Workspace 情境都更快、更便宜、更可靠或更安全;不能把 Google 公布的 benchmark、SynthID、背景推理或 async function calling 描述當作獨立品質、安全或合規驗證。正式採用前,需固定模型版本、API/runtime、語音與視覺輸入、工具契約、turn/interrupt policy、任務分布與品質門檻,重測完成率、barge-in/turn latency、tool-call success、錯誤恢復、輸出 token、音訊分鐘數、人工接手與完整任務成本。未加入 verified;本次只有 process-level primary-source checks,沒有獨立 human verification,也未執行 API 或 benchmark。
Rights boundary
BusinessNext article、Google 官方部落格、Google AI for Developers 文件、其圖片、圖表、影片與外部 benchmark 均為外部著作或網站內容。本次僅保存 metadata、faithful summary、claim ledger、必要的 claim-tracing 連結與證據界線;未保存全文、HTML、圖片、影片、模型權重、資料集或任何 credential。canonical links 是後續查核入口,來源 ingest 指示不等於取得重製授權。
Footnotes
-
BusinessNext〈語音AI新霸主?Google推出Gemini 3.8 Live雙模型,實測奪冠還能「邊聊邊做事」〉,2026-09-16;canonical URL:https://www.bnext.com.tw/article/92265/google-gemini-3-8-live-extended-thinking-launch。 ↩ ↩2 ↩3 ↩4
-
Google The Keyword,〈Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking〉,2026-09-15;https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/。 ↩ ↩2 ↩3 ↩4
-
Google AI for Developers,〈Gemini 3.8 Live〉,擷取 2026-09-16;https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live。 ↩ ↩2
-
Google AI for Developers,〈Gemini 3.8 Live Extended Thinking〉,擷取 2026-09-16;https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live-extended-thinking。 ↩ ↩2
-
Google AI for Developers,〈Gemini Developer API pricing〉,擷取 2026-09-16;https://ai.google.dev/gemini-api/docs/pricing。 ↩