觀點網訊:中金公司研究部認為,V4.1-Flash通過架構和推理系統優化,以更低的計算、存儲和訪存成本,實現更高的任務完成效率與單位GPU產出。

技術方面,V4.1-Flash的Global KV Cache壓縮約75%,Persistent KV Cache壓縮約87.5%;其Prefill和Decode階段每Token分別僅激活約8B和16B參數。

定價方面,V4.1-Flash的API價格較V4進一步下降,採用2026年9月10日起執行的新定價;V4-Flash及V4-Pro採用DeepSeek於2026年8月17日起執行的V4系列API定價。