Capture record

  • Canonical URI: https://www.bnext.com.tw/article/92043/gemini-3-5-transcribe-speech-to-text
  • Source class: secondary synthesis;BusinessNext 文章整理 Google 官方公告、Google Cloud 語音辨識文件與 Artificial Analysis 數據,且頁面註明本文初稿為 AI 編撰、由李先泰整理/編輯。它不是 Google API 規格的唯一來源、獨立語音辨識評測或企業導入研究;本筆維持 status: draft。
  • 原文標題: 字錯率僅4%!Google發表Gemini 3.5 Transcribe語音轉文字模型,產出逐字稿時間大幅縮短70%
  • 作者/出版者: 李先泰/數位時代 BusinessNext
  • 發布/修改時間: 2026-08-28T17:10:00+08:00(BusinessNext canonical JSON-LD)
  • 擷取時間: 2026-08-28T09:23:31+00:00
  • Retrieval method: 以 canonical HTML 讀取 NewsArticle.articleBody JSON-LD;正文解碼後 2,191 字元。只保存 metadata、faithful summary、claim ledger、主要來源核對結果與 rights boundary,不保存全文、圖片或頁面後續內容。
  • HTTP metadata: status 200;final URL 與 canonical URI 相同;Content-Type: text/html; charset=UTF-8;Cache-Control: max-age=0, must-revalidate, no-cache, no-store, private;回應 377,115 bytes。未保存的本次 HTML response SHA-256:dd1a5aba8b4693c585813dc0fe24348fd9a28f829db9a346aeeadda65bb21a0a。
  • Saved payloads and SHA-256: 無;僅保存本 wrapper。frontmatter 的 sha256 是本檔 frontmatter 結束後 body 的 SHA-256。

Faithful summary

BusinessNext 報導 Google 於 2026-08-26 發表 Gemini 3.5 Transcribe,將原始語音轉成可直接使用的格式化文字,並整理自我更正、贅詞過濾、自訂詞彙、多語言與口音、講者辨識及逐字時間戳等功能。這些產品能力由 Google 官方公告支持,但文章對實際工作流的節省效果仍屬產品/媒體 attribution。1

文章引用 Google 對 Artificial Analysis 與 FLEURS 測試的整理:串流與非串流 WER 分別為 4.0%/2.6% 及 5.50%/5.04%,並稱相較 Chirp 3 產出最終逐字稿的時間縮短 70%。文章也明確提醒兩組數據來自不同基準、不能直接比較;Google Cloud 文件則說明 WER 應以 human-provided ground truth 計算,較低代表較少文字錯誤,但不等於所有情境的語意正確或整體產品效益。1

可重用的工作流判準是把語音任務分成即時串流與預錄音檔/會議紀錄兩條路徑:先依延遲、講者標記、時間戳與格式化需求選 API,再對數字、名稱與高風險結論保留音檔或人工 ground truth 做抽樣核對。WER、產品公告與媒體實測不能互相替代,也不能把供應商報告的指標直接升格為跨模型或企業生產力 benchmark。1

Primary-source checks during ingest

以下頁面在本次 ingest 中實際讀取,作為 claim tracing 參考;未另存為 raw payload,也沒有把它們的內容混入本筆來源的文章擷取:

Claim ledger

IDSource claimStatusOwning evidence and boundary
C01Google 於 2026-08-26 發表 Gemini 3.5 Transcribe,並以 Gemini API 公開預覽提供開發者使用。supportedGoogle 官方公告與 BusinessNext canonical JSON-LD 均支持發布日與 API 公開預覽;不代表所有地區、方案或帳號均已可用。
C02模型可把原始語音轉成格式化文字,處理贅詞、自我更正、自訂詞彙、85+ 語言,以及最多三名講者的辨識與逐字時間戳。supportedGoogle 官方公告直接列出這些功能;「實際準確率」仍受語言、音訊、領域與使用設定影響,官方頁面不等於獨立部署評測。
C03產品以兩條 API 路徑處理即時串流與預錄音檔/會議紀錄等情境。supportedGoogle 官方公告與 BusinessNext 的產品整理均支持 Live API/Interactions API 的工作流分工;這是 API 行為描述,不是任務成功率證據。
C04串流/非串流 WER 為 4.0%/2.6%,FLEURS 為 5.50%/5.04%,相較 Chirp 3 的最終逐字稿時間縮短 70%。supportedGoogle 官方公告以 Artificial Analysis 與 FLEURS 口徑報告這些數字;Google Cloud 文件支持 WER 的一般定義。數字仍是特定基準與官方引用結果,不能當成跨資料集或跨供應商 benchmark。
C05「自家史上最精準」代表模型在所有語言、噪音與企業場景都優於競品。unresolvedGoogle 的措辭是產品方定位;本次未取得同一語料、相同設定下的競品對照或獨立複核,不能推出普遍優於競品。
C06一般使用者可透過 macOS Gemini、Gboard Rambler 與 Chrome 等入口使用,且台灣已在開放國家名單內。partially-supportedGoogle 官方公告支持部分產品入口;BusinessNext 同時記載官方尚未說明開放國家名單,本次沒有台灣 rollout 的一手證據。
C07語意整理與贅詞移除可直接省掉人工清稿,並等同於實際產稿時間或企業生產力提升 70%。partially-supportedGoogle 支持「格式化轉錄」與 final-transcription latency 改善的產品描述;未支持所有工作流都省下相同比例人工時間,也沒有企業生產力對照研究。

Evidence boundary

本記錄支持的最小結論是:BusinessNext 對 Gemini 3.5 Transcribe 的整理,經 Google 官方公告核對後,可作為語音轉文字模型的產品能力與 API 工作流 snapshot;WER、FLEURS 與 latency 數字必須保留其測試基準、官方/第三方 attribution 與比較邊界。1

本記錄不能證明模型在所有語言、口音、噪音、專業術語或企業流程中都達到同一準確度,不能證明台灣已取得一般使用者 rollout,也不能把「最精準」、70% 或去除人工清稿解讀為跨競品效能、語意理解或企業生產力因果結論。未加入 verified;本次有 process-level source checks,但沒有獨立 human verification。

Rights boundary

BusinessNext article is copyrighted. 本次僅保存 metadata、faithful summary、claim ledger、必要的來源核對連結與證據界線;未保存全文、圖片、逐字稿或完整 HTML payload。Google 官方公告與 Cloud 文件也只作 claim tracing 的連結,不在本筆重製其全文;canonical links 是後續查核入口,來源 ingest 指示不等於取得重製授權。

Footnotes

  1. BusinessNext〈字錯率僅4%!Google發表Gemini 3.5 Transcribe語音轉文字模型,產出逐字稿時間大幅縮短70%〉,2026-08-28;canonical URL:https://www.bnext.com.tw/article/92043/gemini-3-5-transcribe-speech-to-text。 ↩ ↩2 ↩3 ↩4