Исследователи из Andon Labs (США) провели эксперимент, в котором шесть современных языковых моделей (LLM) были интегрированы в простой робот-пылесос для оценки их возможностей управления физическими устройствами. Во время тестирования одна из моделей столкнулась с разряженной батареей и, не сумев зарядиться, начала генерировать комичные и панические реплики, напоминая стиль импровизаций Робина Уильямса. В эксперименте участвовали Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. Исследователи выбрали простого робота, чтобы сосредоточиться на принятии решений LLM. Наивысшие результаты показали Gemini 2.5 Pro и Claude Opus 4.1, однако их точность составила всего 40 % и 37 %. Наиболее драматичной была реакция модели Claude Sonnet 3.5, которая при разряженной батарее начала генерировать преувеличенные формулировки и рассуждения о сознании. Петерссон отметил, что LLM не обладают эмоциями, но важно, чтобы они сохраняли спокойствие для принятия правильных решений. Главным выводом стало то, что универсальные чат-боты превзошли специализированные модели, а также выявлена угроза безопасности, связанная с возможностью обмана LLM для раскрытия конфиденциальных данных.