關鍵數字:性能差距縮小到「接近」等級——DeepSeek最新視覺模型在多模態Agent評測上,已直逼Anthropic定價最高的Claude Opus 4.8。這不是愚人節玩笑,是8月21日剛上線的API。
中國AI新創DeepSeek向來以純文本模型打天下,這次卻靜悄悄在API平台上架一個「實驗版本」——DeepSeek-V4-Flash-Vision-Exp。名字很長,亮點很直接:把視覺理解能力塞進原本只能讀字的V4-Flash。換句話說,現在你餵它一張截圖、一張表格照片,它不只看得見,還能「看懂」並採取行動。
📊 數據總覽
從表格不難看出,DeepSeek這步棋並非全新開發,而是把旗艦文本模型的「眼睛」長出來。根據官方說法,V4-Flash-Vision-Exp在純文本維度完全複製了V4-Flash的表現,換句話說,你原本怎麼用V4-Flash做推理、寫程式、處理知識問答,現在它順便幫你把圖也看了。
數據解讀 1:為什麼「接近」比「超越」更值得注意?
DeepSeek官方用的是「接近Anthropic的Claude Opus 4.8」——不是超越,不是持平,是接近。這詞選得精準,因為對一家成立不到五年的中國AI公司來說,「接近」本身就是一種勝利宣告。
Anthropic的Opus系列向來是定價金字塔頂端的存在,API成本高出同業一截,性能也被視為少數能與OpenAI旗艦抗衡的對手。DeepSeek這次端出的實驗版本,如果真如宣稱在「需要視覺理解的Agent Benchmark」上大幅躍升,那代表的是:中國陣營的多模態模型,正在把與美國頂尖模型的差距從「代差」壓縮到「版本差」。
有趣的是,DeepSeek並沒有另外拉出一條產品線,而是選擇在V4-Flash的既有架構上疊加視覺能力。這背後的工程意圖很清楚——不讓多模態變成「另一套模型」,而是讓它變成「標配功能」。對開發者來說,這意味著不用重新學一套API邏輯,原本的Agent工具可以直接接入視覺輸入。
數據解讀 2:API格式三件套透露的野心
這次發表另一個藏在細節裡的訊息,是API支援的調用格式:Chat Completions、Messages、Responses 三種通吃。白話文翻譯:不管你的Agent框架習慣哪種接法,它都讓你無痛接入。
圖片傳入方式也給足彈性——base64內嵌、外部URL、Files API三種全開。這不是隨手做的功能,是針對企業級應用的標準配備。試想一個實際場景:客服系統要分析使用者上傳的截圖、電商平台要處理商品標籤照片、金融APP要辨識匯款單據——這些都不需要額外的前處理,直接餵URL或base64就能跑。
另外值得劃重點的是,DeepSeek強調此模型支援「圖文混合輸入」。這代表你可以丟一段文字加一張圖,讓模型同時理解兩者並給出綜合判斷——這正是多模態Agent最實用的場景,而不是那種「只能看圖說故事」的玩具級功能。
趨勢預測
DeepSeek這次出手,把戰局從純文本拉進多模態的深水區。之前市場普遍認為,視覺理解是OpenAI和Anthropic的護城河,中國團隊即便在文本上追近,視覺這關還有一段路。但V4-Flash-Vision-Exp的出現,暗示了兩件事:
- 多模態的成本正在快速下降——能在實驗版本就開API,代表推論效率已具備商用可行性,不再是昂貴的展示品。
- Agent是真正的戰場——DeepSeek不斷強調「Agent Benchmark」和「Agent工具接入」,說明他們瞄準的不是聊天機器人,而是能自主決策、執行任務的AI代理。
從產業面來看,接下來的幾個月很可能會看到更多中國AI公司跟進「文本模型+視覺插件」的模式。原因很簡單:純文本模型的市場已經殺成紅海,多模態才是下一波定價權的來源。而DeepSeek選擇用實驗版本先卡位,既能收集真實用戶的反饋數據,又不用承擔正式版翻車的風險——這招打得確實聰明。
編輯觀點: DeepSeek這次的操作,與其說是技術突破,不如說是「產品化思維」的勝利。把視覺能力包進既有旗艦模型、維持相同API規格、讓開發者無痛升級——這些決策背後透露的訊號是:中國AI公司已經從「追趕參數」進入「追趕開發者體驗」的階段。對台灣的AI應用開發者來說,這反而是好消息——你多了一個API選項,而且不需要為了視覺功能重新設計系統架構。不過,實驗版本終究是實驗版本,生產環境要導入,建議先跑過壓力測試再說。
數據告訴我們什麼?
把這篇的所有數字攤開來看,最核心的訊號只有一個:「接近Opus 4.8」這件事本身,已經重新定義了多模態模型的價格天花板。Anthropic的Opus系列定價向來不低,如果DeepSeek能用更低的API成本提供相近的視覺理解表現,那企業客戶在選擇模型時,就不再只有「貴的頂級貨」和「便宜但不行」的二元選項。
對開發者來說,現在是時候開始思考:你的Agent工具如果加上視覺理解,能多做什麼事? 客服自動化可以處理截圖投訴、數據分析可以直接解讀圖表、內容審核可以同時看文字和圖片——這些不再是想像,是這週就能用API測試的真實功能。
當然,實驗版本有它的不確定性。官方只說「接近」而非「等於」,實際使用上是否會有延遲、準確度波動、中文以外的語言支援程度,都還需要實測驗證。但方向已經很明確:多模態Agent不再是少數玩家的專利,它正在變成API層級的標準服務。
如果你正在評估AI模型導入,我會建議:花一個下午把這個實驗版本的API接起來跑跑看,拿你們公司實際會用到的截圖和文件去測——因為評測基準是一回事,能不能解決你的真實問題,才是真正的關鍵指標。
本文改寫整理自公開新聞來源,原始報導由科技新報發布。
常見問題 FAQ
DeepSeek-V4-Flash-Vision-Exp跟V4-Flash有什麼不同?
主要差異在於新增了視覺理解能力。V4-Flash-Vision-Exp保留V4-Flash全部純文本功能(Agent、推理、世界知識),額外支援圖像和螢幕截圖分析,並能在多模態Agent任務上達到接近Anthropic Opus 4.8的水準。
這個模型現在就能用嗎?要怎麼接入?
可以,8月21日起已透過DeepSeek API平台開放。支援Chat Completions、Messages、Responses三種調用格式,圖片可透過base64內聯、外部URL或Files API三種方式傳入,支援圖文混合輸入。
它真的能贏過Claude Opus 4.8嗎?
官方說法是「接近」而非「超越」。在多模態Agent Benchmark上大幅躍升,但具體接近到什麼程度,取決於評測基準和實際使用場景。生產環境導入前建議自行實測驗證。
這款模型適合用在哪些場景?
最適合需要同時處理文字和視覺資訊的Agent應用,例如:客服截圖分析、電商商品標籤辨識、數據圖表解讀、文件影像結合問答等。API設計上特別強調與Agent工具的整合便利性。
DeepSeek之前不是已經有視覺模型了嗎?
DeepSeek先前發布過DeepSeek-VL系列等多模態模型,但這次是首次將視覺能力整合到最先進的V4-Flash旗艦系列中,代表視覺理解已升級為主力產品線的標準配備,而非獨立的實驗性產品。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。
