Заголовки

Исследование креативности: люди против языковых моделей

В журнале Nature Human Behaviour опубликовано исследование, в котором исследователи из Гонконгского и Северо-Западного университетов проанализировали креативность 9198 человек и восемь больших языковых моделей (LLM) в тесте на дивергентное мышление. В ходе эксперимента было выполнено 215 542 прогона моделей. Результаты показали, что GPT-4 Turbo набрал 81.78 балла, превышая средний человеческий результат (78-80 баллов), в то время как Claude 3.5 Sonnet и китайская Ernie 4.0 получили 80.01 и 76.17 соответственно. При сравнении лучших 10% людей и GPT-4 Turbo люди показали статистически значимое превосходство (p < 0.001).

Используя Divergent Association Task, где необходимо называть 10 различных существительных, исследователи оценили креативность по семантической дистанции. Выяснилось, что у людей дисперсия результатов значительно выше, в то время как LLM выдают стабильные результаты, но с повторяющимися словами. Авторы ввели термин "креативная мимикрия" для описания того, как LLM имитируют оригинальность, используя статистические манипуляции. Популярные техники, такие как "думай как Стив Джобс", оказались неэффективными. Исследователи пришли к выводу, что LLM могут быть полезны для рутинных задач, но для действительно инновационных идей необходимы люди.