DeepSeek veröffentlichte die ersten Ergebnisse des Agent-Benchmarks für V4-Flash-Vision-Exp und zeigte dabei eine Aufteilung von 2-2 gegenüber Opus 4,8 über vier multimodale Agent-Evaluationen hinweg. Laut ChainCatcher erzielte das Modell 27,3 gegenüber 25,7 bei Agents' Last Exam und 35,0 gegenüber 34,0 bei ZeroBench, während Opus 4,8 bei ApexBench mit 39,4 gegenüber 36,5 und bei Chartography mit 65,0 gegenüber 64,3 die Nase vorn hatte.
Im Vergleich zum textbasierten V4-Flash-0731 verbesserte sich die Vision-Version bei ApexBench von 26,2 auf 36,5 und bei Agents' Last Exam von 25,2 auf 27,3. DeepSeek sagte, dass die textbasierte Version multimodalen Inhalt ignoriert, sodass die Zugewinne vor allem die Hinzufügung visueller Eingaben widerspiegeln.
DeepSeek sagte außerdem, dass die textbasierte Agentenleistung nach dem Hinzufügen von Vision nicht wesentlich zurückgegangen ist. In sieben Text-Benchmarks lagen sechs Werte über V4-Flash-0731: darunter stieg DeepSWE von 54,4 auf 59,3, über Opus 4.8s 58,0, und Toolathlon erreichte 75,9, nahe an Opus 4.8s 76,2. Die Ergebnisse stammen aus eigenen Tests von DeepSeek, nicht aus einem unabhängigen Drittanbieter-Ranking. Öffentliche Code-Agent-Textaufgaben nutzten DeepSeek Harness im Minimalmodus mit der maximalen Reasoning-Einstellung.
