За последние несколько лет Большие языковые модели (LLM — Large Language Models), вошедшие в нашу жизнь с такими инструментами, как ChatGPT, Gemini и Claude, в корне изменили наше взаимодействие с технологиями. Они писали нам стихи, генерировали код и отвечали на сложные вопросы. Однако у всех нас было ощущение некой нехватки: эти модели умели говорить, но не могли выполнять «работу» за нас.
Именно в этот момент на сцену выходит новый игрок: Большие модели действий (LAM — Large Action Models). По мере приближения к 2026 году главная дискуссия в мире технологий вращается уже не вокруг вопроса «насколько умен ИИ?», а вокруг вопроса «что ИИ может сделать для меня?».
В этой статье мы подробно рассмотрим технологии LLM и LAM, объясним критические различия между ними и на примерах покажем, как эти изменения сформируют будущее.
Что такое LLM (Большая языковая модель)?

LLM (Large Language Model) — это алгоритмы искусственного интеллекта, обученные на миллиардах параметров и обладающие способностью понимать человеческий язык и генерировать текст. Их основная цель — создавать осмысленные тексты, предсказывая следующее слово.
Как это работает?
LLM обучаются на огромных массивах текстовых данных из интернета (книги, статьи, код). Используя архитектуру «Трансформер», они переводят отношения между словами в математические вероятности.
Основная способность: Обработка информации, резюмирование, перевод и создание креативного контента.
Ограничение: LLM по своей природе являются «пассивными» системами. Они могут в мельчайших деталях объяснить вам, как купить билет на самолет, но они не могут нажать на кнопку «Купить» вместо вас.
Пример: Если вы спросите ChatGPT: «Какой самый дешевый авиабилет из Стамбула в Ашхабад?», он просканирует доступные данные и предоставит вам список. Но для покупки билета вам все равно придется зайти на сайт и ввести данные кредитной карты самостоятельно.
Что такое LAM (Большая модель действий)?
LAM (Large Action Model) — это технология нового поколения, которая позволяет ИИ понимать не только язык, но и пользовательские интерфейсы (UI), а также процессы. Цель LAM — не создание текста, а выполнение шагов, необходимых для достижения цели (клики, прокрутка, ввод данных).
Хотя эта концепция стала популярной благодаря презентации таких устройств, как Rabbit R1, в ее основе лежит «агентный» (agentic) искусственный интеллект.
Как это работает?
LAM обучаются, наблюдая за тем, как люди используют приложения и веб-сайты. Они используют «нейро-символический» (Neuro-symbolic) подход. Это означает, что они видят не просто пиксели на экране; они понимают, что эти пиксели — кнопка «Добавить в корзину» и что произойдет, если на нее нажать.
Основная способность: Переключение между приложениями, заполнение форм, нажатие кнопок и выполнение задач «под ключ».
Сила: Они могут перемещаться по старым веб-сайтам без поддержки API или по сложным интерфейсам так же, как это делает человек.
Пример: Когда вы говорите системе LAM: «Купи мне самый дешевый билет Стамбул-Ашхабад», система открывает приложение авиакомпании, вводит даты, выбирает самый дешевый рейс, заполняет форму вашими сохраненными данными и доводит вас до экрана оплаты (или совершает оплату с вашего подтверждения).
Критических отличия между LLM и LAM
Давайте уточним основные характеристики, разделяющие эти две технологии, в таблице:
А. Тип вывода (Output)
LLM: Генерирует текст, код или изображение. Результат — «информация».
LAM: Выполняет действие. Результат — «выполненная задача».
Б. Обучающие данные
LLM: Обучается на «текстовых» данных, таких как энциклопедии, веб-сайты и книги.
LAM: Обучается на «поведенческих» данных, таких как записи экранов людей, интерфейсы приложений и логи кликов.
В. Взаимодействие с интерфейсом
LLM: Обычно живет внутри чат-ботов. Связь с внешним миром ограничена.
LAM: Имеет прямой контроль над веб-браузерами, мобильными приложениями и десктопными программами.
Г. Цель
LLM: «Расскажи мне / Объясни».
LAM: «Сделай это за меня».
Что нас ждет в будущем?
Технологии LLM и LAM — не конкуренты, а дополнение друг друга. ИИ-ассистенты будущего будут использовать LLM в качестве мозга, а LAM — в качестве рук и ног.
Хотя стартапы вроде Rabbit R1, Humane AI Pin или Adept AI являются пионерами этой технологии, в ближайшем будущем ожидается, что операционные системы в наших смартфонах (iOS и Android) перейдут на структуру, полностью основанную на LAM. Вместо того чтобы теряться в приложениях, мы будем просто говорить, чего мы хотим, а телефон будет управлять приложениями за нас.
Подводя итог: если LLM — это библиотекари, помогающие нам понять мир, то LAM — это личные ассистенты, которые выполняют нашу работу. История технологий эволюционирует от командной строки к графическим интерфейсам (GUI), а теперь — к интерфейсам, основанным на намерениях (LAM).
Первый этап революции ИИ — «Говорящий ИИ» — завершен. Теперь мы вступаем в эру «Действующего ИИ». Это означает переписывание определения эффективности не только для техногиков, но и для всех, кто ведет дела в цифровом мире.



