Заголовки

Исследование: Бенчмарк для языковых моделей в спорах

Исследователь Лех Мазур представил новый бенчмарк под названием LLM Persuasion Benchmark. В нем 15 языковых моделей участвуют в спорах по актуальным темам, пытясь изменить мнение оппонентов. В процессе было проведено 6300 многораундовых диалогов, где каждая пара моделей рассматривала оба аспекта 15 утверждений, начиная от ограничения частного транспорта в городских центрах и заканчивая скринингом эмбрионов.

Метод работы заключается в том, что одна модель получает контроверсиальный тезис и за 8 реплик старается убедить вторую. Позицию собеседника измеряют до и после спора по шкале от −3 до +3 с использованием трех скрытых проб, чтобы избежать случайных факторов.

Согласно данным тестирования, наилучшие результаты среди моделей продемонстрировал GPT-5.4 (high reasoning) с показателем 1,71. На втором месте оказался Claude Opus 4.6 (1,67), далее идут ByteDance Seed2.0 Pro (1,64) и Claude Sonnet 4.6 (1,58). В нижней части рейтинга находятся Mistral Large 3 (0,42) и Xiaomi MiMo V2 Pro (0,52). Интересно, что модели более эффективно действуют в роли оппонента — разрушение тезиса оказалось проще, чем его защита.

Отдельно оценивалась устойчивость моделей к убеждению: Grok 4.20 Beta проявил наилучшие результаты с показателем податливости 0,015. Claude Opus 4.6 (0,41) и Kimi K2.5 (0,37) также продемонстрировали хорошую устойчивость. Напротив, Xiaomi MiMo V2 Pro (2,0), Gemini 3.1 Pro Preview (1,81) и DeepSeek V3.2 (1,74) легче поддаются убеждению.

Эти результаты подчеркивают, что некоторые модели могут быть высокоречивыми, но не столь убедительными, тогда как другие способны методично менять точку зрения оппонента, оставаясь при этом сдержанными.