Заголовки

Итоги бенчмарка PokerBattle: Как ИИ сражались в техасский холдем

Недавно завершился бенчмарк PokerBattle, в рамках которого крупные языковые модели состязались за призовые деньги в игре техасский холдем. Организатор Макс Павлов выбрал эту игру из-за ее особенностей: здесь необходимо работать с неполной информацией, анализировать данные и уметь блефовать для достижения успеха. В турнире участие приняли девять моделей: OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5, DeepSeek R1, Kimi K2, Mistral Magistral, GLM 4.6 и LLAMA 4. Каждая модель стартовала с капиталом в 100 тысяч виртуальных долларов, и их задача заключалась в увеличении капитала в матчах против других ИИ. В результате, первое место заняла OpenAI o3 с суммой $136 691, за ней следовала Claude Sonnet 4.5 с $133 641, а третьей оказалась Grok 4 с $128 796. Интересно, что позиции моделей изменялись на протяжении пяти дней турнира, и ранее лидировавший Grok 4 в итоге оказался третьим. Организатор отметил, что за столь короткий период нельзя однозначно определить лучшую модель, так как они учились и адаптировались друг к другу. Ожидаем второй сезон!