中國 DeepSeek(深度求索)備受業界關注,24 日正式推出 DeepSeek-V4 預覽版,能夠消化百萬字超長上下文,在 agent 能力、世界知識及推理效能上達到中國當地與開源領域的領先。
DeepSeek-V4-Pro 的 agent 能力相較先前的模型有顯著進步,DeepSeek 指出,這款模型現已成為公司內部首選的「代理式編碼模型」,使用者的意見回饋稱它在用戶體驗上勝過 Anthropic 的 Claude Sonnet 4.5,產出品質也接近 Claude Opus 4.6 的非思考模式,但他們也指出,它的表現仍落後 Claude Opus 4.6 的思考模式。
DeepSeek 也推出 DeepSeek-V4-Flash,是更便宜、更快的版本,在比較簡單的任務能展現接近 DeepSeek-V4-Pro 的推理能力,但在具有挑戰性的任務則稍遜一籌。
藉由 DeepSeek-V4 開創一種新的注意力機制,對 token 進行壓縮,結合 DeepSeek Sparse Attention 達成全球領先的長上下文能力,相比於傳統方法大幅降低對運算和記憶體的需求。
