На рынке нейросетей очередная неделя приносит новые бенчмарки. GPQA Diamond проверяет уровень знаний PhD, Lexometrica оценивает точность, а LLM Persuasion Benchmark выявляет способности в дебатах. Последний, Chatbot Arena, фиксирует предпочтения пользователей. Однако возникает вопрос: зачем создавать ещё один бенчмарк? Ответы просты. Во-первых, ценность таких систем заключается в их независимом подтверждении результатов: например, GPT-5.4 занимает первое место во всех перечисленных бенчмарках. Во-вторых, нет систематического бенчмарка, который бы сопоставлял российские модели с глобальными на практических задачах. В нашем исследовании проведено тестирование 54 моделей на 32 сценариях на русском языке с использованием двух LLM-судей. Результаты показали, что Claude Sonnet 4.5, занявший второе место у нас, оказался лишь на 17-м в GPQA Diamond. Интересно, что среди доступных без VPN моделей лишние места занимают исключительно китайские, а российские модели пока не могут похвастаться высоким качеством работы в сопоставимых сценариях. Это подчеркивает важность правильной формулировки задач для ИИ, чтобы избежать значительных расхождений в результатах.