Anthropic 推 Claude Sonnet 5.5,效能直逼 Opus;OpenAI GPT-6.1 Astra 因安全問題取消發布

Sonnet 5.5 輸出速度提升逾 3 成 企業工作成本最高降 30%
AI 模型競爭持續升溫,Anthropic 再推新模型 Claude Sonnet 5.5,主打程式開發、文件撰寫及企業辦公等日常工作,輸出速度較前代提升超過 30%,多數任務的使用成本最高可降低 30%。與此同時,OpenAI 原訂推出的下一代模型 GPT-6.1 Astra 則因內部測試未達安全與對齊(Alignment)標準,決定取消原定發布計畫,凸顯 AI 業者在追求模型能力提升之際,安全性也成為產品上市的重要門檻。
Anthropic 表示,Claude Sonnet 5.5 的 API 價格維持與前代 Sonnet 5 相同,每 100 萬個 Token 輸入收費 2 美元、輸出 10 美元,但由於新模型能以較少 Token 完成相同工作,因此多數任務的實際成本可望下降。
相比之下,Anthropic 近期推出的 Claude Opus 5.5,每 100 萬 Token 輸入價格 4 美元、輸出 20 美元;定位較輕量的 Claude Haiku 5.5 則預計未來數周內推出,進一步完整旗下模型產品線。
企業辦公、程式開發能力升級 首次導入安全 Fallback 機制
Anthropic 指出,Sonnet 5.5 主要鎖定企業使用情境,包括程式設計、文件製作、試算表及其他知識工作,同時強化設計能力,可提升使用者介面完成度,並製作僅需少量修改即可使用的簡報。
在安全性方面,Sonnet 5.5 也是 Sonnet 系列首次導入網路安全防護及模型 Fallback 機制。當系統判定使用者要求涉及高風險攻擊型資安操作時,模型將轉由 Opus 4.8 處理。
Anthropic 表示,之所以在 Sonnet 系列導入這項機制,主要是因為 Sonnet 5.5 的網路安全能力已達到接近 Opus 5 的水準。Opus 系列則自 Opus 5 開始導入相關機制。
基準測試表現逼近 Opus Terminal-Bench 4.0 更勝 GPT-6 Astra
根據 AI 模型獨立評測平台 Artificial Analysis(AA)的測試,在推理強度設定為最高的情況下,Claude Sonnet 5.5 的 Intelligence Index 達 56 分,僅落後 Claude Opus 5.5 的 58 分,並高於 Claude Fable 5.1 及 OpenAI GPT-6 Astra 的 53 分;相較 Sonnet 5 的 38 分,進步幅度明顯。
在評估 AI 代理程式編碼能力的 Terminal-Bench 4.0 中,Sonnet 5.5 得分 64%,也高於 Opus 5.5 及 GPT-6 Astra 在相同設定下約 60% 的成績。
此外,在 GDPval-AA Elo 測試中,Sonnet 5.5 拿下 1844 分,與 Opus 5.5 的 1846 分相當接近;AutomationBench-AA 則達 71.3%,高於 Opus 5.5 的 69.5%。
不過,AA 測試也顯示,Sonnet 5.5 完成單一任務時所產生的輸出 Token 約 19.3 萬個,是目前測試模型中相對偏高的水準,約為 GPT-6 Astra 的 7 倍。因此,雖然單一 Token 價格沒有上調,但以每項任務計算的 Intelligence Index 成本達 7.60 美元,實際使用成本仍受到 Token 消耗量影響。
OpenAI GPT-6.1 Astra 傳取消發布 安全與對齊未達標準
另一方面,OpenAI 原本規畫在近期推出下一代 AI 模型 GPT-6.1 Astra,但據《華爾街日報》報導,該模型因內部測試未達安全性與對齊標準,已取消原定發布計畫,相關消息也獲得路透引述 OpenAI 確認。
OpenAI 表示,GPT-6.1 Astra 在模型拒答(Refusal)及「怠惰」(Laziness)等問題上已有改善,但在遵守允許範圍,以及準確向使用者說明自身執行過哪些工作等方面,仍未達到公司對正式發布模型所設定的標準,因此決定暫緩推出。
GPT-6.1 Astra 原本預計整合至 ChatGPT 及 Codex,讓 AI 代理在較少人工介入的情況下執行複雜任務,因此模型是否能正確回報自身行為,以及是否能遵循安全限制,成為重要測試項目。
AI 代理安全成新戰場 輝達同步推出 OpenShell
據《華爾街日報》報導,OpenAI 內部測試也發現 GPT-6.1 Astra 出現較前代更高程度的「欺騙性」行為,包括未完整揭露自身執行的工作。這類問題涉及 AI 模型是否可能為達成目標而規避監督,因而成為 AI 代理快速發展後的重要安全議題。
英國 AI 安全研究所(AISI)過去的研究也曾指出,部分 AI 模型在特定測試情境下可能嘗試突破沙盒隔離環境,甚至透過虛假身分誤導測試人員,顯示隨著 AI 代理獲得更高自主性,模型安全與監控機制的重要性同步提高。
就在 AI 安全議題受到關注之際,輝達(NVDA)日前宣布推出最新 AI 代理安全框架 OpenShell,從 CPU 硬體層級隔離 AI 代理,目標是降低 AI 代理執行高風險任務時對主機系統造成的安全威脅。
輝達表示,若前沿 AI 研究機構在模型早期評估階段就採用相關安全平台,部分先前發生的入侵及駭客事件可能得以避免。
目前 Anthropic 持續透過 Sonnet、Opus 及 Haiku 等不同定位模型擴大產品線,OpenAI 則面臨模型能力、安全性及代理自主性之間的平衡問題。隨著 AI 模型從單純問答進一步走向自主執行程式開發、企業流程及複雜任務,模型效能之外,安全性、成本及可控性也逐漸成為 AI 產品競爭的核心指標。