Capture record

  • Canonical URI: https://www.bnext.com.tw/article/92117/meta-muse-spark-1-3
  • Source class: secondary synthesis。BusinessNext 整理 Meta Muse Spark 1.3 的發布、模型行為、Artificial Analysis 評測與成本估算,並引用 Meta 官方部落格、Meta 評測方法、Bloomberg 與 Artificial Analysis。文章初稿為 AI 編撰、整理編輯/李先泰;本筆保留各來源 attribution,不把標題、產品宣稱或單一 benchmark 升格為 AI Ark 的獨立能力、安全或成本結論,維持 status: draft。
  • 原文標題: Meta推出旗艦模型Muse Spark 1.3!汪滔稱「史上最大躍進」,發文狠嗆:Gemini誰啊?
  • 作者/出版者: 李先泰/數位時代 BusinessNext
  • 發布/修改時間: 2026-09-03T11:40:00+08:00(BusinessNext NewsArticle JSON-LD)
  • 擷取時間: 2026-09-03T05:29:54+00:00
  • Retrieval method: BusinessNext 先以 web_extract 讀取,再以 Python urllib 直接 HTTP GET 核對 canonical、JSON-LD 與 response metadata;Meta 官方部落格、Meta 評測方法 PDF 與 Artificial Analysis 以 web_extract 讀取,並以 Python urllib 核對 HTTP;Bloomberg 以 web_extract 取得標題與導言,直接 HTTP GET 回 403 Forbidden,未把未讀取的全文當作證據。全程未使用 browser;只保存 metadata、faithful summary、claim ledger、必要來源連結與 rights boundary,不保存文章、HTML、PDF、圖片、影片、模型或 benchmark payload。
  • HTTP metadata: BusinessNext status 200、Content-Type: text/html; charset=UTF-8、response Date: Thu, 03 Sep 2026 05:28:22 GMT、response 306,498 bytes、requested/final URL 相同;Meta 官方部落格 status 200、Content-Type: text/html; charset=utf-8、response Date: Thu, 03 Sep 2026 05:28:23 GMT、188,229 bytes;Meta 評測方法 status 200、Content-Type: application/pdf、response Date: Wed, 02 Sep 2026 22:50:26 GMT、273,003 bytes;Artificial Analysis status 200、Content-Type: text/html; charset=utf-8、response Date: Thu, 03 Sep 2026 05:28:23 GMT、392,180 bytes;Bloomberg 直接 HTTP status 403 Forbidden。
  • Saved payloads and SHA-256: 無;只保存本 wrapper。frontmatter 的 sha256 是本檔 frontmatter 結束後 body 的 SHA-256,未對未保存的 HTML、PDF、圖片、影片、模型或 benchmark payload 宣稱可重現 hash。

Faithful summary

BusinessNext 報導 Meta 於美國時間 2026-09-02 發布 Muse Spark 1.3;既有 reasoning 模式可透過 Muse Code 與 Meta Model API 使用,max reasoning 則須完成額外安全測試後推出。Meta 官方部落格支持 Muse Spark 1.3 已在 Muse Code 與 Meta Model API rollout,並稱模型針對較長時程、多工作流、模糊指令澄清、不可逆動作確認與能力邊界辨識做了調整。這些是 Meta 的產品發布與行為說法,不是 AI Ark 的獨立效能或安全測試。12

Meta 官方另稱,相較 Muse Spark 1.2,Muse Spark 1.3 在常見 coding workflow 中約少 20% tool calls、25% tokens,並改善 adversarial inputs、prompt injections 與長任務中的判斷。Meta 的評測方法說明,結果主要透過 Meta Model API 產生;比較時可能使用 named agent product、固定 harness、benchmark provider harness 或共同內部 framework,並以可比的 primary metric 選取結果;無法評分的回答與 model refusal 留在分母並給零分。這些方法界線支持「評測結果依模型設定、harness、任務與分母解讀」,但未由本筆重跑。23

Artificial Analysis 對 Muse Spark 1.3 的獨立分析報告:目前可用的 xhigh 版本在 Artificial Analysis Intelligence Index 得 61 分,limited preview 的 max 版本得 62 分;xhigh 相較 Muse Spark 1.2 的 57 分上升 4 分。agentic evaluation 的變化包括 Tau3-Bench Banking 由 35% 升至 47%(max 為 52%)、Terminal-Bench 2.1 由 80% 升至 85%(max 為 86%),以及 GDPval-AA v2 Elo 由 1,615 升至 1,709(max 為 1,754)。同一分析也記錄 AA-LCR 與 AA-Omniscience 的小幅退步;max 版本使用更多 turns 與 reasoning tokens,不能把較高分數解讀成無成本的能力提升。這些是 Artificial Analysis 在其方法與設定下的結果,不等於跨 harness、跨任務或所有 provider 的通用排名。4

Artificial Analysis 以 Meta 的每百萬 input/output token 1.25/4.25 美元、cached input 0.15 美元的價格估算,Muse Spark 1.3 xhigh 每個 Intelligence Index task 約 0.55 美元;其分析稱這是得分 59 以上模型中的低成本案例,但仍高於 Muse Spark 1.2 的約 0.40 美元,原因之一是 agentic evaluations 的 input tokens 約多 57%。這是第三方以特定評測、effort 與價格假設計算的 task cost,不是 AI Ark 帳單或企業 ROI。4

BusinessNext 引述 Bloomberg 對 Meta 首席人工智慧官 Alexandr Wang 的訪問,整理其「史上最大效能躍進」、與近期 OpenAI/Anthropic 模型競爭及模型比較不易的說法;Bloomberg 的導言可讀到 Meta 發布更強模型、能力接近頂尖競爭者,但全文直接 HTTP 受限,本筆不把受訪者的比較或「贏過」說法升格為獨立 benchmark。15

安全與發布治理方面,Meta 官方稱 Muse Spark 1.3 加強 adversarial robustness、prompt-injection resistance,並將 max reasoning 放在額外安全測試之後。BusinessNext 另報導 Muse Spark open weights 仍是未來方向,但沒有確認 Muse Spark 1.3 已開放權重;Meta 官方頁只把 open weights 列為 roadmap。現階段可支持的是「產品入口與推理模式分層、額外安全測試是 release gate」,不能推出已完成獨立安全驗證或 open-weight availability。21

Primary-source checks during ingest

以下頁面在本次 ingest 中實際讀取,作為 claim tracing 參考;未另存完整 response payload:

Claim ledger

IDSource claimStatusOwning evidence and boundary
C01BusinessNext 92117 報導 Meta 發布 Muse Spark 1.3,作者為李先泰,發布/修改時間為 2026-09-03T11:40:00+08:00。supportedBusinessNext JSON-LD 與正文直接支持;只代表文章 metadata 與報導內容。
C02Muse Spark 1.3 已在 Muse Code 與 Meta Model API rollout,max reasoning 需額外安全測試後推出。supportedMeta 官方發布文直接支持產品入口與發布 gate;不等於安全測試結果已公開或獨立驗證。
C03Meta 稱 1.3 改善長時程 agentic work、模糊指令澄清、不可逆動作確認、prompt-injection resistance,並相較 1.2 約少 20% tool calls、25% tokens。partially-supportedMeta 官方頁支持供應商自述;未在 AI Ark 任務或公開可重現設定中測量 tool calls、tokens、品質或安全效果。
C04Meta 的評測使用 Meta Model API,依 benchmark 使用 named product、固定/共同 harness,拒答或無法評分回答留在分母並給零分。supportedMeta 官方評測方法直接支持方法說明;不代表各 benchmark 的最佳設定、完整資料或外部公平性已獨立確認。
C05Artificial Analysis 報告 Muse Spark 1.3 xhigh/max 的 Intelligence Index 為 61/62,agentic 任務較 1.2 改善,Tau3-Bench Banking 為 47%/52%、Terminal-Bench 2.1 為 85%/86%、GDPval-AA v2 為 1,709/1,754 Elo。partially-supportedArtificial Analysis 頁面支持其分析結果;分數受 variant、effort、harness、任務切分與其比較方法限制,不作通用 SOTA 結論。
C06Muse Spark 1.3 xhigh 的 AA-LCR 與 AA-Omniscience 小幅退步,max 以更多 turns/reasoning tokens 換取部分 agentic 分數提升。partially-supportedArtificial Analysis 支持數值與解釋;未取得完整原始 traces 或在 AI Ark 任務重現。
C07Muse Spark 1.3 xhigh 每個 Intelligence Index task 約 0.55 美元,低於其分析中得分 59 以上的多數模型,但高於 Muse Spark 1.2 約 0.40 美元。partially-supportedArtificial Analysis 的 task-cost estimate 支持;價格、cache、effort、token 分母與 benchmark workload 不是 AI Ark 實際帳單。
C08Alexandr Wang 稱這是 Meta 史上最大效能躍進,並認為模型可與近期 OpenAI/Anthropic 模型競爭。observationalBusinessNext 引述 Bloomberg;Bloomberg 只取得導言,受訪者比較與跨模型優勢沒有完整 primary text 或獨立 benchmark 支持。
C09Muse Spark 1.3 已經是 open-weight,或其 open-weight 版本已有確定發布日期。unresolvedMeta 官方只把 Muse Spark open weights 列為 roadmap;BusinessNext 報導未確認 1.3 已開放或有確定日期。
C10Muse Spark 1.3 在 AI Ark 既有 provider、harness 與任務中一定比 1.2 或其他模型更快、更便宜、更可靠或更安全。unresolved本輪未執行模型、API、工具 loop、prompt-injection、benchmark 或內部任務重測;需固定 task distribution、effort、harness、quality gate 與 full task cost。

Evidence boundary

截至 2026-09-03 UTC,本筆能支持的最小結論是:Meta 發布 Muse Spark 1.3,官方將它接入 Muse Code 與 Meta Model API,並把 max reasoning 的推出置於額外安全測試之後;Meta 也自述模型在長時程 agentic/coding 工作、澄清、不可逆動作確認與 prompt-injection robustness 上改善。Artificial Analysis 在自己的 Intelligence Index 與 task-cost 方法下觀察到 agentic 評測上升,但部分分數依賴更多 turns/reasoning tokens,且存在少數退步與較高 task cost。可重用的 AI Ark 判準是把 model + inference effort + tool loop + harness + task distribution + full task cost + release gate 一起評估;token 單價或綜合分數都不能單獨代表任務經濟性。

本記錄不能證明 Muse Spark 1.3 在所有 agent workflow 都更好、更便宜、更安全或更可靠,不能把 Artificial Analysis 的分數與成本外推為跨 provider、跨 harness 的通用排名,也不能把 Meta 的 prompt-injection、adversarial robustness 或額外安全測試敘述當成獨立安全保證。正式採用前,需固定模型版本、provider、effort、工具契約、任務分布、品質門檻與資料政策,重測完成率、patch/artifact correctness、拒答與誤答、prompt-injection robustness、輸出/輸入 token、tool-call 回合、retry、延遲、人工審查與完整任務成本。未加入 verified;本次只有 process-level primary-source checks,沒有獨立 human verification,也未執行模型或 benchmark。

Rights boundary

BusinessNext article、Meta 官方部落格與評測方法、Artificial Analysis 文章、Bloomberg 文章及其圖片、圖表、影片與 benchmark 均為外部著作或網站內容。本次僅保存 metadata、faithful summary、claim ledger、必要的 claim-tracing 連結與證據界線;未保存全文、HTML、PDF、圖片、影片、模型權重、資料集或任何 credential。canonical links 是後續查核入口,來源 ingest 指示不等於取得重製授權。

Footnotes

  1. BusinessNext〈Meta推出旗艦模型Muse Spark 1.3!汪滔稱「史上最大躍進」,發文狠嗆:Gemini誰啊?〉,2026-09-03;canonical URL:https://www.bnext.com.tw/article/92117/meta-muse-spark-1-3。 ↩ ↩2 ↩3

  2. Meta AI Research,〈Introducing Muse Spark 1.3〉,2026-09-02;https://research.meta.ai/blog/introducing-muse-spark-1-3。 ↩ ↩2 ↩3

  3. Meta AI Research,〈Muse Spark 1.3 Multimodal Evaluation Methodology〉,2026-09-02;https://research.meta.ai/static/muse-spark-1-3-multimodal-evaluation-methodology。 ↩

  4. Artificial Analysis,〈Muse Spark 1.3: Meta reaches the frontier〉,2026-09-02;https://artificialanalysis.ai/articles/muse-spark-1-3。 ↩ ↩2

  5. Bloomberg,〈Meta Releases More Powerful AI Model, Edging Closer to Rivals〉,2026-09-02;https://www.bloomberg.com/news/articles/2026-09-02/meta-releases-more-powerful-ai-model-edging-closer-to-rivals。 ↩