Нейросети научили общаться без слов. Российский Mostik хочет передавать между моделями сами «мысли»

Когда несколько нейросетей работают вместе, сегодня они делают это удивительно примитивным способом.

Представим простейшую систему.

Большая модель исследует задачу и приходит к какому-то выводу. Затем она превращает всё, что поняла, в текст:

Вот мой анализ. Я считаю, что проблема находится здесь, потому что…

Этот текст получает другая модель.

Она читает его, снова превращает слова во внутренние математические представления и только после этого продолжает работу.

То есть две машины, внутри которых информация существует в виде огромных многомерных числовых структур, вынуждены разговаривать друг с другом примерно как два человека в переписке.

Через слова.

Российский стартап Mostik предлагает убрать этот промежуточный перевод.

И если подход действительно масштабируется, архитектура будущих AI-систем может измениться довольно сильно.

У нейросети внутри вообще нет слов

Это одна из вещей, которую легко забыть, разговаривая с ChatGPT.

Мы пишем:

Почему небо голубое?

Получаем нормальный человеческий текст.

Кажется, будто где-то внутри модели сидит маленький очень быстрый собеседник, который тоже размышляет предложениями.

Нет.

Внутри современной большой языковой модели информация постоянно представляется в виде векторов — огромных наборов чисел.

Слово превращается в математическое представление.

Затем оно проходит через множество слоёв нейросети.

На каждом слое это представление меняется.

Связывается с контекстом.

С другими словами.

С понятиями.

С отношениями между объектами.

К моменту, когда модель собирается выдать следующий токен, внутри существует значительно более богатая структура, чем предложение, которое мы в итоге видим.

А потом всё это приходится снова ужать до:

«Поэтому я рекомендую вариант номер два».

Текст — очень удобный интерфейс для человека. Но для машины он может быть бутылочным горлышком

Допустим, большая модель анализировала сложную задачу.

Внутри возникли представления:

о причинных связях;

сомнениях;

альтернативных вариантах;

структуре задачи;

вероятностях;

важных деталях;

отношениях между десятками объектов.

А теперь ей говорят:

Передай результат следующему агенту.

Она должна всё это вербализовать.

Часть информации неизбежно исчезает.

Потому что человеческий язык — довольно узкий канал.

Это как попросить инженера передать другому инженеру не чертёж, модель и данные измерений, а только голосовое сообщение:

Ну, в общем, там деталь примерно вот такая.

Работать можно.

Но странно.

А потом второй модели приходится делать обратную операцию

Она получает текст.

Читает.

И снова строит внутри себя математическое представление смысла.

Получается цепочка:

внутреннее состояние модели А → человеческий язык → токены → внутреннее состояние модели Б.

Причём оба преобразования стоят вычислений.

Первая модель тратит ресурсы на генерацию ответа.

Вторая — на его чтение и обработку.

В мультиагентной системе это повторяется постоянно.

Агент исследователь написал отчёт.

Агент-критик его прочитал.

Агент-планировщик прочитал вывод критика.

Следующая модель получила итоговый план.

В какой-то момент цифровая команда начинает тратить значительную часть бюджета на то, чтобы объяснять самой себе то, что она только что знала.

Mostik предлагает построить настоящий мост

Отсюда, собственно, название.

Идея состоит в том, чтобы взять скрытое внутреннее состояние одной нейросети и научиться преобразовывать его в формат, который способна использовать другая модель.

Без промежуточного длинного текста.

В опубликованном эксперименте разработчики взяли очень большую китайскую модель GLM-5.2 примерно на 753 миллиарда параметров и маленькую Qwen примерно на 4 миллиарда.

Большая модель получает запрос.

Начинает его обрабатывать.

Но вместо того чтобы самой генерировать длинный ответ, передаёт часть своего внутреннего представления через специально обученный bridge — мост.

После этого ответ пишет маленькая Qwen.

Получается довольно странный организм.

Думает гигант. Говорит малыш.

И самое интересное — обе исходные модели при этом можно не переучивать

Это важно.

Разработчики не берут GLM и Qwen и не начинают обучать их заново как единую систему.

Их веса остаются замороженными.

Обучается именно промежуточный преобразователь — тот самый мост, который должен понять:

вот такое внутреннее состояние большой модели соответствует вот такому полезному состоянию маленькой.

По сути это переводчик.

Только он переводит не:

русский → английский,

а:

математический язык одной нейросети → математический язык другой.

И вот здесь становится очень интересно.

Потому что разные модели вообще-то думают на разных «языках»

Это не универсальный формат.

У одной модели другое количество слоёв.

Другой размер скрытого состояния.

Другая архитектура.

Другое обучение.

Другое внутреннее пространство признаков.

Нельзя просто взять массив чисел из GLM и сунуть его в Qwen со словами:

разбирайся.

Для второй модели этот набор чисел будет примерно таким же содержательным, как случайный шум.

Поэтому мост должен научиться преобразовывать одно внутреннее пространство в другое.

Это похоже на очень необычный машинный перевод.

Только ни на одной стороне нет человеческого языка.

По заявлениям Mostik, даже первый эксперимент дал заметный результат

Маленькая Qwen сама по себе, естественно, значительно слабее гигантской GLM.

Но после получения скрытого состояния большой модели её качество заметно выросло.

Команда сообщает, что связка закрыла примерно половину разрыва между маленькой и большой моделью, а качество Qwen относительно самостоятельной работы выросло примерно на четверть.

При этом генерировать весь ответ огромной GLM уже не требуется.

А именно генерация большого количества выходных токенов крупной моделью — дорогая операция.

Отсюда появляется экономия.

Здесь важно аккуратно с фразой «в двадцать раз дешевле»

Потому что интернет такие цифры любит.

И очень быстро превращает:

в этом эксперименте определённая связка требует примерно в двадцать раз меньше стоимости полного вывода большой модели

в:

НОВАЯ ТЕХНОЛОГИЯ ДЕЛАЕТ ЛЮБОЙ ИИ В 20 РАЗ ДЕШЕВЛЕ.

Нет.

Пока такого вывода делать нельзя.

Mostik показывает конкретную архитектуру и конкретное сравнение.

Большая модель всё равно участвует в вычислении.

Мост тоже требует ресурсов.

Маленькая модель генерирует ответ.

И итоговое качество не становится равным большой GLM.

Получается компромисс:

намного дешевле полного использования гиганта и заметно умнее маленькой модели.

А вот насколько хорошо эта экономика переносится на другие модели и реальные production-задачи — ещё нужно проверять.

Но сама идея мне кажется намного интереснее цифры 20×

Потому что сегодня индустрия строит AI примерно как коллектив людей.

Есть исследователь.

Редактор.

Критик.

Программист.

Арбитр.

Все передают друг другу документы.

Это естественно, потому что такие системы проектировали люди.

Мы просто скопировали знакомую организационную модель.

Пусть один агент напишет отчёт.

Другой его прочитает.

Третий проверит.

Но зачем машинам обязательно имитировать человеческий офис?

У них нет глаз, которым нужен текстовый документ.

Им вообще не нужны слова для понимания информации.

Текст нужен нам.

Я особенно хорошо чувствую проблему на собственном конвейере

У меня автоматическая редакция Дзен работает примерно по классической современной схеме.

Одна модель делает черновик.

Другая редактирует.

Следующая проверяет.

Арбитр принимает решение.

И между каждым этапом передаётся вполне человеческая информация: текст статьи, замечания, структурированный JSON, список исправлений.

Это удобно.

Можно открыть лог и понять:

ага, редактор вот это исправил, а контролёр вот здесь возмутился.

Но вычислительно схема довольно смешная.

DeepSeek сформировал смысл.

Превратил его в тысячи токенов.

Claude получил эти токены и снова построил смысл внутри себя.

Потом GPT получает ещё один текст и повторяет операцию.

Наши нейросети буквально ведут производственное совещание в письменном виде.

😁

А что, если следующая версия конвейера сможет передавать часть смысла напрямую?

Автор сформировал черновик и одновременно внутреннее представление:

вот центральный тезис;

вот структура;

вот места низкой уверенности;

вот отношения между фактами;

вот стилистическое намерение.

Редактор получает не только текст.

Он получает состояние автора.

Не в человеческом психологическом смысле, конечно.

А математическое представление задачи.

Тогда ему, возможно, будет гораздо проще понять не только:

что написано,

но и:

что предыдущая модель пыталась сделать.

Это уже совершенно другая архитектура AI-команд.

Может оказаться, что знаменитые chain-of-thought вообще были временным костылём

Сегодня сложную модель часто заставляют «рассуждать».

Внутренние вычисления в каком-то виде разворачиваются на множество шагов.

Иногда система создаёт дополнительные reasoning tokens.

Это помогает качеству, но стоит вычислений.

А затем значительную часть результата снова приходится преобразовать в другой формат.

Если одна модель способна передать другой полезное промежуточное состояние напрямую, часть этой текстовой инфраструктуры потенциально становится ненужной.

Не обязательно вся.

Но сама идея:

AI обязан объяснить другому AI свои мысли словами

перестаёт быть очевидной.

Впрочем, здесь есть серьёзная проблема прозрачности

Когда агент написал:

Я отверг вариант А, потому что цена слишком высокая, а сроки плохие.

Человек может это прочитать.

Проверить.

Поспорить.

Когда агент отправил другой модели вектор длиной несколько тысяч чисел…

Успехов.

😁

Мы получаем более эффективный канал между машинами.

Но одновременно теряем наблюдаемость.

А для серьёзных систем это очень неприятно.

Представьте банковского агента.

Он передал следующему агенту скрытое состояние.

Тот отказал клиенту в кредите.

Регулятор спрашивает:

почему?

Ответ:

Ну… вектор был такой.

Не лучший отчёт.

Поэтому текст никуда полностью не исчезнет

Особенно там, где человеку нужно контролировать процесс.

Скорее появятся два канала.

Машинный канал — богатое внутреннее состояние для следующей модели.

Человеческий канал — короткий объяснимый лог:

увидел это;

решил это;

использовал такие данные;

получил такой результат.

То есть нейросети между собой могут общаться значительно эффективнее, но параллельно оставлять нам понятный протокол.

Это похоже на компьютерные сети.

Машины передают друг другу бинарные пакеты.

Никто не требует:

отправляйте весь интернет человеческими предложениями.

Но при необходимости мы можем посмотреть журнал событий.

Есть ещё один огромный вопрос — насколько универсальными окажутся такие мосты

Сегодня мост обучили между конкретными архитектурами.

А нам хочется больше.

GLM → Qwen.

Claude → DeepSeek.

GPT → локальная модель.

Изображение → языковая модель.

Видео → планировщик.

Роботическая модель → LLM.

Если для каждой пары требуется отдельное дорогое обучение, получим прекрасную таблицу:

70 моделей × 69 возможных соседей.

Немного неудобно.

Настоящий прорыв появится, если удастся создать универсальное промежуточное пространство, к которому можно подключать разные модели.

Что-нибудь вроде USB для нейросетевых мыслей.

Представьте стандартный «язык смыслов»

Модель что-то поняла.

Перевела внутреннее состояние в универсальное latent representation.

Любая другая совместимая система может его использовать.

Тогда архитектура AI меняется радикально.

Большая reasoning-модель решила трудную часть.

Маленькая модель пишет текст.

Отдельная визуальная модель создаёт изображение.

Роботическая модель превращает результат в действие.

И всем им не нужно каждый раз делать круг:

смысл → русский язык → токены → смысл.

Возникает настоящий машинный протокол мышления.

Звучит очень сильно.

Но до такого стандарта нам пока далеко.

И слово «мысли» здесь, конечно, надо брать в кавычки

Я специально это подчёркиваю.

У нейросети нет доказанной субъективной мысли в человеческом смысле.

Hidden state — не маленькая фраза:

хм, кажется, Сергей опять выбрал сложную задачу.

😁

Это математическое состояние сети после обработки информации.

Называть его «мыслью» удобно журналистски.

Но если начать воспринимать метафору буквально, через пять минут появятся:

учёные впервые подключились к сознанию ИИ.

Нет.

Пока мы всего лишь научились немного эффективнее передавать вычисленные представления между моделями.

Само по себе это и так достаточно интересно.

Причём именно маленькая модель на выходе может оказаться большим бизнесом

Представим крупную модель.

Она великолепно рассуждает.

Но генерировать каждым её параметром тысячи токенов дорого.

Что если использовать гиганта только для сложной части?

Он обработал задачу.

Передал сжатое представление.

А дешёвая модель быстро превратила его в:

письмо;

отчёт;

JSON;

код;

ответ клиенту.

Получается архитектура:

дорогой интеллект коротко думает → дешёвый исполнитель долго говорит.

Это довольно разумно.

Мы уже делаем похожее вручную через маршрутизацию моделей.

Только сегодня передаём результат человеческим текстом.

Особенно полезно это может быть для edge-устройств

Телефон.

Автомобиль.

Робот.

Очки.

Небольшая локальная модель находится прямо на устройстве.

Она быстрая и дешёвая.

Но сложную задачу иногда не тянет.

Тогда облачная большая модель может выполнить тяжёлое reasoning и передать локальной не длинный текстовый ответ, а компактное богатое состояние.

После этого локальная модель продолжает работу сама.

Потенциально меньше трафика.

Меньше задержка.

Дешевле генерация.

Больше работы остаётся на устройстве.

Если подход действительно получится обобщить, здесь может появиться очень интересная экономика.

А ещё большие модели могут стать чем-то вроде учителей в реальном времени

Сегодня есть distillation — дистилляция.

Большая модель обучает маленькую на огромном количестве примеров.

После этого маленькая работает самостоятельно.

Но обучение обычно происходит заранее.

Mostik предлагает нечто концептуально другое.

Большая и маленькая модель работают вместе во время конкретного запроса.

Гигант помогает малышу прямо сейчас.

Не переписывая его веса.

Это уже похоже не на университет:

сначала пять лет учись, потом работай.

А на постоянного эксперта за спиной:

сложную часть понял я, дальше оформляй.

Почему тогда просто не попросить большую модель дать короткий ответ?

Хороший вопрос.

Если задача совсем простая — возможно, именно так и надо сделать.

Но генерация каждого выходного токена большой моделью всё равно требует запуска её вычислительной архитектуры снова и снова.

Ответ в несколько тысяч токенов может быть дорогой.

А маленькая модель генерирует его намного дешевле.

Главная ставка Mostik именно в этом:

использовать большую модель там, где действительно нужен её интеллект, и не использовать её огромную мощность для механического вывода каждого следующего слова.

Это очень похоже на то, что сейчас происходит в обычной промышленности.

Не заставлять профессора десять минут заполнять форму.

Пусть профессор решит сложную часть.

Форму заполнит система подешевле.

Но пока перед нами всё-таки ранняя технология

Это, пожалуй, самое важное после красивых идей.

У нас пока нет достаточного количества независимых исследований, которые бы показали:

да, метод устойчиво работает между разными семействами моделей и на большом спектре настоящих задач.

Нет массовых production-кейсов.

Нет отраслевого стандарта.

Не доказано, что качество всегда сохраняется.

Неясно, насколько сложно обучать мосты между очень разными архитектурами.

И особенно интересно, что произойдёт после обновления одной из исходных моделей.

Модель изменила внутренние представления.

Мост всё ещё понимает её?

Или его нужно обучать заново?

Это вполне может оказаться серьёзной эксплуатационной проблемой.

Есть и вопрос безопасности

Допустим, одна модель может передать другой информацию, которую человек вообще не видит.

Тогда скрытый канал становится потенциальным каналом:

нежелательных инструкций;

атаки;

утечки данных;

манипуляции следующей моделью.

В обычном текстовом агентном контуре можно хотя бы поставить фильтр:

что здесь написано?

В latent-канале всё сложнее.

Нужно будет учиться проверять не только текстовые сообщения между агентами, но и их внутренние представления.

Потрясающе.

Мы ещё не научились нормально защищать email, а уже проектируем безопасность телепатии между роботами.

😁

Но сама проблема, которую решает Mostik, абсолютно реальна

Сегодня стоимость мультиагентной системы быстро растёт именно из-за повторной обработки контекста.

Первый агент прочитал документ.

Второй снова прочитал документ плюс вывод первого.

Третий получает уже документ, вывод первого и замечания второго.

Контекст пухнет.

Токены бегут.

Latency растёт.

И в конце разработчик смотрит на счёт:

А точно нам нужны семь агентов?

Очень правильный вопрос.

Если часть смысловой информации можно передавать компактнее, мультиагентные системы могут стать значительно практичнее.

Возможно, это вообще изменит наше представление о «маленькой модели»

Сегодня параметры примерно связываются с возможностями.

Очень грубо:

большой мозг умнее маленького.

Но если маленькая модель способна регулярно получать интеллектуальные состояния от огромной системы, её самостоятельный размер перестаёт полностью определять качество.

Она становится выходным органом более крупной распределённой системы.

Как рука человека.

Рука сама по себе не особенно интеллектуальна.

Но за ней стоит мозг.

Маленькая Qwen в эксперименте Mostik начинает играть немного похожую роль.

Она не обязана самостоятельно провести всё рассуждение.

Ей нужно хорошо превратить уже богатое представление в полезный результат.

А дальше можно представить не две модели, а целую сеть

Большой исследователь.

Маленький исполнитель.

Визуальная модель.

Кодовая.

Роботическая.

Модель памяти.

Каждая специализирована.

Но вместо огромных текстовых отчётов они обмениваются компактными внутренними представлениями.

Получается уже не:

команда цифровых сотрудников.

А что-то больше похожее на единый распределённый мозг, где разные области выполняют разные функции.

И тут аналогия с человеческим мозгом становится довольно красивой.

Зрительная кора не пишет моторной:

Уважаемая моторная кора! Информирую вас, что справа летит мяч. Прошу поднять руку.

Информация проходит между системами иначе.

Мы просто до сих пор заставляли искусственные модели общаться так, как удобно нам.

Правда, человеческий мозг вырос как единая система

А современные AI-модели создавали разные компании.

С разной архитектурой.

Разными данными.

Разными целями.

Поэтому состыковать их значительно сложнее.

Но если появятся хорошие универсальные мосты, это может уменьшить значение вопроса:

какая одна модель самая лучшая?

Можно будет собрать систему из компонентов.

Эта великолепно рассуждает.

Эта быстро генерирует.

Эта видит.

Эта работает локально.

Эта управляет роботом.

А между ними — общий транспортный слой.

И это направление мне вообще нравится значительно больше очередной гонки:

наша модель теперь на 2,7% выше на benchmark.

Особенно после истории с агентами

Мы только что разбирали огромный хайп вокруг AI-агентов.

Одно из моих главных впечатлений после исследования: настоящая ценность появляется не тогда, когда мы создаём побольше виртуальных персонажей.

Она появляется, когда вся система выполняет законченную работу дешевле или лучше.

Если мост между моделями снижает стоимость такого workflow — это реальный инженерный прогресс.

Если просто позволяет написать:

наши агенты теперь общаются мыслями!

— это прекрасный материал для курса за 79 990 рублей.

😁

Пока Mostik находится где-то между этими двумя состояниями.

Именно поэтому за проектом интересно следить.

Для российского стартапа это ещё и довольно необычный угол

Большая часть нынешнего AI-бизнеса строится поверх существующих моделей.

Обёртка.

Агент.

Сервис.

Интеграция.

Mostik полез глубже — в сам способ взаимодействия нейросетевых архитектур.

Это значительно более рискованный путь.

Потому что непонятно, сработает ли технология массово.

Но если сработает, ценность находится не в очередном приложении.

Она находится на уровне инфраструктуры AI.

А инфраструктурные технологии иногда оказываются гораздо важнее самих продуктов, которые первым делом замечают пользователи.

И у меня здесь появляется очень практичный интерес

Сейчас моя собственная автоматическая редакция передаёт между моделями именно текст и структурированные результаты.

Это правильно для сегодняшнего уровня технологии: я могу всё посмотреть, проверить, сохранить и воспроизвести.

Но если через несколько лет появится надёжный стандарт передачи latent representations, я совершенно не уверен, что подобные конвейеры останутся текстовыми внутри.

Человеку будет показываться статья.

Логи.

Решения.

А модели между собой могут передавать значительно более богатую информацию.

Такие эксперименты с несколькими моделями, агентами и автоматическими конвейерами я как раз постоянно ковыряю в GPT-Лаборатории: Telegram, ВКонтакте и MAX. Mostik в этом смысле для меня не просто интересная новость — это возможный намёк на то, как через несколько поколений придётся перестраивать саму оркестрацию AI.

И есть ещё один философский эффект

Пока машины разговаривают человеческим текстом, нам легко сохранять иллюзию, что мы понимаем происходящее.

Агент написал:

Я проанализировал данные и решил…

Очень знакомо.

Очень по-человечески.

Мы можем даже начать приписывать модели внутренний монолог.

Но если выяснится, что самый эффективный способ общения двух AI вообще не похож на язык, это хорошо напомнит:

машинный интеллект не обязан быть цифровой копией человеческого.

Мы построили его на математике.

А язык прикрутили прежде всего потому, что нам нужен интерфейс.

Возможно, «говорящие» нейросети однажды окажутся всего лишь первым поколением

Сегодня сам факт свободного разговора с компьютером кажется фундаментальным.

И для человека он таким и останется.

Но внутри системы текст может постепенно потерять статус универсального транспорта.

Модель будет говорить с человеком словами.

С базой — запросами.

С программами — API.

С роботом — управляющими представлениями.

А с другой нейросетью — чем-то, чему у нас пока даже нет нормального названия.

Hidden states.

Latents.

Embeddings.

«Мысли» в кавычках.

Неважно.

Главное — второй машине человеческий перевод больше не понадобится.

И вот тогда фраза «нейросети разговаривают друг с другом» станет технически неправильной

Они не разговаривают.

Они передают понимание.

Если Mostik действительно удалось сделать первый практичный шаг в эту сторону, его сегодняшний эксперимент с огромной GLM и маленькой Qwen может оказаться намного важнее, чем выглядит сейчас.

Но пока я бы оставил шампанское закрытым.

Нам нужны независимые тесты.

Другие пары моделей.

Реальные production-задачи.

Экономика на больших объёмах.

Проверка качества.

И понимание того, насколько устойчиво работает мост после обновления моделей.

После этого можно будет говорить о новой архитектуре AI всерьёз.

А пока самое интересное уже произошло.

Кто-то впервые задал очень правильный вопрос:

Почему две нейросети вообще обязаны объяснять друг другу что-либо человеческими словами?

И чем дольше я об этом думаю, тем более странной кажется нынешняя система.

Возможно, мы просто заставляем машины разговаривать вслух потому, что пока не научили их нормально шептаться.