高通揭新一代 Hexagon NPU 鎖定手機端代理式 AI

發佈時間:2026/09/14 · 編輯整理

導入新加速器與 MoE 架構 瞄準 AI 常駐運作

高通(Qualcomm)於美國時間 10 日公布新一代 Hexagon 神經網路處理器(NPU),主打支援代理式 AI(Agentic AI)持續運作。新設計首度導入 Element Accelerator、擴增 50% 的共享記憶體,並採用混合專家(MoE)架構,目標是讓搭載 Snapdragon 平台的智慧型手機更有效率地理解使用者情境、跨應用程式推理並執行任務。

Element Accelerator 強化 Transformer 運算 共享記憶體增半

高通表示,新增的 Element Accelerator 針對 Transformer 模型運算設計,可與 Hexagon 既有的純量、向量及矩陣運算單元協同工作,加速大型語言模型(LLM)處理,同時兼顧行動裝置的功耗效率。

新一代 Hexagon 的共享記憶體容量較前代增加 50%,可在處理器內保留更多模型狀態、啟動值及中間張量資料,減少與外部 DRAM 往返傳輸的次數。高通指出,此舉有助降低延遲與資料瓶頸,讓 AI 維持更長的對話脈絡,並加快回應及任務切換。

MoE 架構支援最高 30B 模型 生成時啟動約 3B 參數

在模型架構方面,新一代 Hexagon 導入 MoE 設計,透過多個專門模型分工處理不同任務,而非由單一大型模型包辦所有運算。

高通稱,新 NPU 可運行參數規模最高達 300 億(30B)的 MoE 模型;生成每個 Token 時,約啟動 30 億(3B)參數進行運算。搭配快閃記憶體管理與快取技術,系統可依需求將專家模型載入 DRAM,並讓常用的模型參數留在快取中,以降低功耗與記憶體頻寬需求。

支援多種數值精度 INT4 預處理速度提升最高 50%

新架構也擴大數值精度支援範圍,涵蓋 FP16、FP8,以及 INT8、INT4 與 INT2 等格式。高通表示,在 INT4 模型環境下,處理使用者提問、進行前置運算的 Prefill 速度最高提升 50%;解碼吞吐量與推測解碼能力也有所改善,回覆啟動時間可控制在 1.5 秒內。

CPU、GPU 與 NPU 協同 Snapdragon Summit 將揭更多細節

高通指出,新 Hexagon 將與 Snapdragon 平台中的其他運算單元更緊密合作。採用 Oryon 架構的 CPU 負責協調多階段 AI 工作流程,並適時向 NPU 供應資料;Adreno GPU 則導入受 NPU 設計啟發的專用加速架構,支援將 AI 即時整合至手機遊戲圖形處理。

高通 AI 產品管理副總裁比內什・蘇庫馬(Vinesh Sukumar)表示,新一代 Hexagon NPU 將為代理式 AI 奠定基礎,並期望透過下一代高階 Snapdragon 行動平台,在智慧型手機本機實現代理式 AI 體驗。高通預計於美國時間本月 22 日至 24 日舉行的 Snapdragon Summit 公布更多細節。

提到的股票

概念股

參考資料