Домой ИИ и технологии Google DeepMind переосмыслил указатель мыши: Gemini научили понимать, на что именно указывает...

Google DeepMind переосмыслил указатель мыши: Gemini научили понимать, на что именно указывает пользователь

Разработчики предлагают использовать курсор как «лазерную указку» для ИИ-агента, чтобы упростить взаимодействие с контентом на экране.

Исследователи из подразделения Google DeepMind представили концепцию AI-enabled pointer — нового типа курсора, который превращает обычное наведение мыши в полноценное взаимодействие с искусственным интеллектом. Вместо длинных текстовых промптов пользователь сможет просто указать на нужный объект и дать короткую команду вроде «сравни это», «объясни» или «перемести сюда».

В компании считают, что сам принцип взаимодействия с компьютером практически не менялся последние полвека: курсор по-прежнему обозначает лишь координаты на экране. DeepMind предлагает сделать следующий шаг — научить систему понимать не только положение указателя, но и смысл того, на что именно смотрит пользователь.

Новая концепция строится вокруг идеи контекстного ИИ. Сегодня большинство ИИ-инструментов работают в отдельных окнах: пользователю приходится копировать текст, загружать изображения или самостоятельно описывать проблему. В Google стремятся убрать этот барьер и встроить ИИ прямо в повседневную работу с интерфейсом.

Google DeepMind переосмыслил указатель мыши: Gemini научили понимать, на что именно указывает пользователь
Google DeepMind переосмыслил указатель мыши: Gemini научили понимать, на что именно указывает пользователь — иллюстрация к материалу. Источник: ixbt.com

Например, пользователь сможет навести курсор на таблицу в PDF-файле и попросить «сделать график», выделить рецепт и сказать «увеличь ингредиенты вдвое» или указать на фотографию здания и запросить «проложи маршрут». Система будет автоматически распознавать контекст: где находится объект, что именно выбрано и какое действие логично выполнить.

Ключевые принципы взаимодействия с ИИ

В основе концепции лежат четыре принципа, которые Google считает критически важными для интерфейсов будущего:

  • Отказ от «ИИ-детуров»: человеку больше не нужно переключаться между рабочим приложением и отдельным чат-ботом.
  • Визуальный контекст: автоматическое распознавание того, что находится непосредственно вокруг курсора.
  • Естественный язык: использование простых речевых команд вместо сложных промптов.
  • Семантизация интерфейса: превращение элементов на экране из набора пикселей в «осмысленные сущности» — адреса, даты, документы и объекты, с которыми нейросеть может работать напрямую.

По сути, DeepMind пытается перенести в цифровую среду привычную человеческую модель общения, где люди постоянно комбинируют речь и жесты. Вместо детальных инструкций мы часто говорим «передвинь это сюда» или «исправь вот здесь», а собеседник считывает контекст по ситуации. В Google уверены, что современные мультимодальные модели, такие как Gemini, уже достаточно развиты, чтобы реализовать аналогичную механику в управлении компьютером.

Реализация в продуктах Google

Компания уже начала внедрять элементы этой концепции. В браузере Google Chrome появилась возможность вызывать Gemini поверх веб-страницы для получения ответов о конкретных элементах сайта. Пользователь может выделить товары для сравнения или указать точку на изображении интерьера, чтобы запросить визуализацию новой мебели.

Кроме того, анонсирована функция Magic Pointer для будущих ноутбуков Googlebook, которые компания проектирует как платформу для постоянного взаимодействия с ИИ. Экспериментальные функции также проходят тестирование в Google AI Studio и лаборатории Google Labs Disco.

Фактически речь идёт о попытке кардинально переосмыслить интерфейс персонального компьютера. Если раньше основными инструментами были мышь и клавиатура, то теперь курсор становится своего рода «лазерной указкой» для ИИ-агента, который понимает не только команды, но и истинные намерения пользователя.

Источник: https://www.ixbt.com