DeepMind, ИИ-лаборатория Google, представила метод «внутриагентной речи», позволяющий роботам создавать внутренний монолог для описания наблюдаемых задач и их связи с действиями. Этот подход, описанный в патентной заявке, помогает роботам обучаться новым задачам без предварительной подготовки, снижая требования к памяти и вычислительным ресурсам, а также повышая предсказуемость поведения в незнакомых условиях.
Метод заключается в том, что роботы анализируют изображения или видео, формируя описания на естественном языке, например: «человек поднимает чашку». Эта внутренняя «речь» связывает визуальные данные с действиями, обеспечивая обучение с нуля («zero-shot»), когда ИИ может работать с новыми объектами без специальной настройки. Такой подход улучшает адаптивность и контекстное понимание.
Технология решает проблему непредсказуемости ИИ-агентов, что важно для их внедрения в робототехнику. Похожие разработки ведут Nvidia и Intel. DeepMind также представила Gemini Robotics On-Device — компактную визуально-языковую модель, работающую автономно на роботах, что обеспечивает быструю реакцию и конфиденциальность, особенно в здравоохранении.
Внутриагентная речь предоставляет дополнительный контекст для обучения, позволяя роботам лучше адаптироваться к новым ситуациям. Это открытие укрепляет позиции DeepMind в создании более автономных и универсальных ИИ-систем для робототехники.
#космос #наука #познавательное #технологии








