中國 AI 模型性能追趕前沿巨擘 「每項任務成本」更展現驚人性價比

發佈時間:2026/08/12 · 編輯整理

DeepSeek V4 Flash 每項任務僅 3 美分 AI 成本戰從「每 Token」進入「每任務」時代

中國 AI 模型正快速縮小與 OpenAI、Anthropic 等全球頂尖前沿模型的性能差距,而且不只是在模型能力上追趕,在更貼近企業實際使用成本的「每項任務成本」(Cost per Task)指標上,更展現出驚人的價格優勢。

根據獨立 AI 模型評測網站 Artificial Analysis(AA)最新分析,在全球前 20 大模型中,中國 AI 新創 DeepSeek 最新的 V4 Flash 以每項任務僅約 3 美分的成本,成為目前性價比最突出的模型之一。

更值得注意的是,中國模型近來不再只是靠「低價」取勝。Moonshot AI 的 Kimi K3、阿里巴巴(BABA)的 Qwen 3.8 Max 等模型皆躋身 AA「Intelligence Index」前十名;若擴大至前二十名,7 月底正式推出的 DeepSeek V4 Flash 也名列其中。

中國 AI 模型不只便宜 性能也快速逼近前沿模型

過去中國 AI 模型普遍以開放權重(Open Weight)及低成本作為主要競爭優勢,但近期新一代模型的性能快速提升,已開始進入全球頂級 AI 模型競爭行列。

AA 最新針對 179 個模型進行評測,其中 DeepSeek V4 Flash 在「Intelligence Index」取得 52 分,每項任務成本卻只有 3 美分。

作為比較,OpenAI 的 GPT-5.6 Luna(max)同樣取得 52 分,但每項任務成本約為 5 美分。也就是說,在 AA 的測試中,兩者的整體智能程度相當,但 DeepSeek 完成相同類型任務的成本更低。

更大的差距則出現在反應速度。DeepSeek V4 Flash 的首次回應時間(TTFT)約為 1.17 秒,完整回答時間約 19.49 秒;GPT-5.6 Luna(max)的 TTFT 則超過 135 秒。

這代表 GPT-5.6 Luna(max)雖然具有更長的推理時間,但使用者實際等待第一個答案出現的時間明顯更久。

AI 成本飆升 企業開始關注「完成一件工作到底要花多少錢」

隨著 AI 從聊天工具逐漸轉向程式開發、企業自動化及 Agent 等複雜工作,企業真正需要負擔的 AI 成本正在快速增加。

過去市場通常以「每 Token 價格」衡量 AI 模型成本,但 Token 價格其實只代表單價,並不能完整反映完成一項工作究竟需要消耗多少 Token 及運算資源。

例如,一個模型雖然每 Token 價格較低,但如果需要大量推理、產生更長的回答,甚至需要多次重試才能完成任務,最終總成本仍可能高於單價較高、但一次就能完成工作的模型。

因此,AA 開始將「每項任務成本」納入評估,將模型實際完成工作的輸入 Token、輸出 Token、快取 Token 及推理 Token 等成本全部計算,再與模型智能程度進行比較。

對企業而言,這個指標可能比單純比較 Token 價格更有參考價值。

Uber、亞馬遜 AI 支出超預算 突顯企業成本控管難題

AI 成本快速增加已成為大型企業的新問題。以 Uber 為例,由於工程師大量使用 Anthropic 的 Claude Code,AI 工具使用量迅速攀升,公司原本編列的年度 AI 預算在 4 月就已提前用罄。

Uber 約 5000 人的工程師團隊逐漸導入 Claude Code 後,AI 支出大幅超出原先預期,公司後續甚至針對每名員工的 Agentic Coding 工具設定每月約 1500 美元的使用上限。

亞馬遜(Amazon)也出現類似情況。根據外媒報導,亞馬遜內部一項利用 Anthropic Claude Sonnet 比對商品及作者資料的 AI 專案,實際成本一度比原先預算高出 860%,最終達到約 180 萬美元。

更棘手的是,這項成本增加持續約 5 個月才被發現。隨著企業大量導入 AI Agent 及推理型工作,模型內部推理所消耗的 Token 激增,AI 成本已從單純的「API 價格問題」,逐漸轉變為企業整體 AI 基礎建設管理問題。

Kimi K3 躋身開放權重模型第一梯隊 性能逼近 Claude、GPT

在 AA 最新評測中,Moonshot AI 的 Kimi K3(max)取得 60 分的 Intelligence Index,在開放權重模型中排名第一,其分數僅比 Claude Opus 5(max)的 63 分低 3 分,也只比 GPT-5.6 Sol(max)的 61 分低 1 分;Kimi K3 每項任務成本約 84 美分,在前沿級模型中仍屬相對低廉。

不過,不同模型的「速度特性」也存在明顯差異。Kimi K3 的 TTFT 約 2.37 秒,代表幾乎可以迅速開始回答,但完整回答時間約 60.52 秒;GPT-5.6 Sol(xhigh)的 TTFT 則約 37 秒,完整回答時間約 58.52 秒。

Claude Opus 5 則呈現另一種優勢,TTFT 約 5.92 秒,完整回答時間僅 14.68 秒,整體完成速度明顯較快。

DeepSeek、Kimi、Qwen 全面進入高性能 AI 競爭

除了 DeepSeek 與 Kimi 外,阿里巴巴旗下 Qwen 系列近期也出現大幅進步。

Qwen 3.8 Max 擁有約 2.4 兆參數,AA Intelligence Index 達到 58 分,排名第 10,成為 Qwen 歷代模型中表現最強的一款。

不過,Qwen 3.8 Max 每項任務成本約 1.13 美元,反而高於部分性能更高的競爭對手,例如 Claude Opus 5(medium)的 59 分/72 美分、GPT-5.6 Sol(xhigh)的 59 分/81 美分、Kimi K3(max)的 60 分/84 美分、Qwen 3.8 Max 的 58 分/1.13 美元

因此,中國 AI 模型目前的競爭力並非全部建立在「價格最低」,而是逐漸形成性能與成本同步提升的競爭模式。

最頂尖模型仍由 Anthropic、OpenAI 領先

從 AA 的 Intelligence Index 來看,60 分以上的模型仍主要集中在 Anthropic 與 OpenAI 等前沿模型。

目前 Claude Opus 5(max、xhigh)最高達到 63 分,但每項任務成本約 2.34 美元;Claude Fable 則是所有受測模型中成本最高者,每項任務約 3.14 美元。

相較之下,開放權重模型中唯一突破 60 分的 Kimi K3,每項任務成本僅 84 美分。

此外,Meta 的 Muse Spark 1.2(xhigh)取得 57 分,每項任務約 40 美分;xAI 的 Grok 4.5(high)則取得 56 分,每項任務約 36 美分,也呈現相當突出的性價比。

「每 Token 便宜」不等於「完成工作便宜」

AA 指出,企業在評估 AI 模型時,不能只看 API 公布的 Token 價格,其實際使用成本還取決於輸入 Token 數量、輸出 Token 數量、推理 Token 數量、完成任務需要多少次嘗試、模型是否需要更長的上下文;尤其是推理型模型,為了完成複雜工作,可能在產生最終答案之前進行大量內部推理。

換言之,即使每 Token 價格便宜,最終完成一項任務的總成本仍可能相當高,這也是為何「Cost per Task」逐漸受到企業重視。

Prompt Cache 非免費 Cache Miss 恐讓成本重新飆升

目前 AI 業者也積極利用 Prompt Caching 降低企業使用成本。當使用者反覆使用相同的對話內容或系統指令時,模型可以透過快取機制重複利用既有 Token,部分業者可提供約 50% 至 80% 的價格優惠。

但快取並非完全免費。如果超過快取有效時間,或使用者修改、刪除對話中間的內容,便可能產生 Cache Miss,使後續內容重新按照正常價格計算。

因此,企業若長時間間隔使用 AI,或頻繁修改 Agent 工作流程,實際成本可能明顯高於單純按照官方 Token 價格估算的結果。

DeepSeek V4 Flash 技術規模龐大 採 MoE 架構

DeepSeek V4 Flash 於 7 月 31 日正式推出,此前已於 4 月與 V4 Pro 一同以預覽形式亮相。

V4 Flash 總參數約 2840 億個,採用 MoE(Mixture of Experts,混合專家)架構,每次僅啟用約 130 億參數,並支援 100 萬 Token 上下文視窗。

相比之下,上位版本 DeepSeek V4 Pro 目前仍處於預覽階段,總參數規模達約 1.6 兆個。

DeepSeek V4 Flash 目前在 AA 評測中所展現的最大優勢,就是在維持前沿模型級智能程度的同時,將單一任務成本壓低至極低水準。

AI 模型競爭進入「性能、成本、速度」三維戰場

值得注意的是,AA 的 Intelligence Index 並非單純測試聊天能力,而是綜合 9 項不同評測,包括 GDPval-AA v2(模擬美國主要職業實務工作)、τ³-Bench Banking(銀行業 Agent 任務)、Terminal-Bench 2.1(終端機與程式開發)、SciCode(科學程式設計)、HLE(高難度綜合知識與推理)、GPQA Diamond(研究所程度科學問題)、CritPt(專業領域批判思考)、AA-Omniscience(廣泛知識準確度)、AA-LCR(長上下文推理),AA 再根據模型在這些任務中實際消耗的 Token 與相關價格,計算每項任務成本。

因此,這項指標更適合用來觀察程式開發、科學研究、數學推理及 Agent 等複雜工作負載,並不代表模型在翻譯、一般聊天或日常辦公等任務上的實際成本。

結論:中國 AI 開始從「低價追趕」進入「高性能+低成本」競爭

整體來看,中國 AI 模型正在快速改變全球 AI 產業競爭格局。過去中國模型最大的優勢主要是開放權重與低價格,如今 DeepSeek V4 Flash、Kimi K3 及 Qwen 3.8 Max 等新模型已開始進入高性能模型排行榜,代表中國 AI 業者正逐漸從單純的價格競爭,進入性能、成本與速度同步競爭的新階段。

值得一提的是,DeepSeek V4 Flash,以 52 分的智能指數、僅 3 美分的單任務成本,展現出相當突出的性價比;Kimi K3 則以 60 分成為目前開放權重模型的頂尖代表。

這也代表一件事:未來 AI 市場的勝負恐怕不再只是「誰的模型最聰明」,而會進一步比拼誰能用最低成本、最快的速度完成工作。

對企業而言,AI 模型選擇也可能從過去的「單一模型至上」逐步轉向多模型策略(Multi-model Strategy),亦即簡單任務使用低成本模型,複雜推理則交給高階模型,藉此在模型性能與 AI 支出之間取得最佳平衡。

提到的股票

概念股

參考資料