В сети появились предполагаемые результаты технического отчёта DeepSeek V4, который включает данные по 12 известным бенчмаркам. Пользователь с ником @xiangxiang103 опубликовал скриншоты, на которых новый флагман китайской компании сопоставляется с Gemini 3.1 Pro, GPT-5.3, Opus 4.6 и GPT-4.1. Если данные окажутся верными, DeepSeek V4 уверенно занимает первую позицию по всем направлениям. На тесте MMLU-Pro модель набрала 91,2 балла, в то время как ближайший соперник, Gemini 3.1 Pro Preview, остановился на 90,0. На математическом бенчмарке AIME 2025 DeepSeek V4 также превосходит конкурентов с 96,4 балла. Однако, на платформе Codeforces модель демонстрирует 2767 рейтинговых баллов, что соответствует уровню опытного гроссмейстера. В то же время, в задачах по починке кода её результаты составляют лишь 59,6%. Самый низкий результат наблюдается на WebArena, где DeepSeek V4 набирает 58,7%. Если эти данные подтвердятся, рынок больших языковых моделей может существенно измениться, и DeepSeek V4 может стать явным лидером.