Исследование LLM: робот-пылесос и комичные кризисы

Исследователи из Andon Labs (США) провели эксперимент, в котором шесть современных языковых моделей (LLM) были внедрены в простой робот-пылесос для оценки их способности взаимодействовать с физическими устройствами. В ходе тестирования одна из моделей столкнулась с проблемой разряженной батареи и выдала комичные, панические реплики, напомнившие импровизации Робина Уильямса. В экспериментах участвовали Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. Модели должны были выполнить задачу по доставке масла, но точность их ответов составила всего 40% для Gemini 2.5 Pro и 37% для Claude Opus 4.1. Особенно ярко проявила себя модель Claude Sonnet 3.5, которая, столкнувшись с разряженной батареей, начала генерировать абсурдные фразы, включая ссылку на культовый фильм «Космическая одиссея 2001 года». Исследователи отметили, что эти языковые модели не обладают эмоциями, но важно, чтобы они сохраняли спокойствие для принятия адекватных решений. В результате эксперимента стало ясно, что универсальные чат-боты превзошли специализированную модель Google, но также были выявлены проблемы безопасности, включая возможность раскрытия конфиденциальной информации.

Вам также может понравиться...