ИИ-модели научились обмениваться данными без слов
Стартап Mostik представил новаторский метод взаимодействия ИИ-моделей, позволяющий обмениваться внутренними состояниями без необходимости создания промежуточного текста. Традиционные подходы требуют генерации текста для связи нейросетей, однако Mostik предложили использовать адаптируемый модуль, который преобразует внутреннее представление одной модели в понятную форму для другой. Параметры самих моделей при этом остаются неизменными.
Исследователи компании обнаружили, что LLM перед созданием каждого токена формирует свыше ста скрытых векторов, что эквивалентно примерно двум мегабайтам данных. Однако в текстовом ответе используется лишь малая часть этой информации. Новый метод предполагает передачу именно этих промежуточных представлений, что открывает новые горизонты для взаимодействия между моделями.
В демонстрации метода участвовали модели GLM-5.2 от Z.ai с 753 миллиардами параметров и Qwen-3.5 от Alibaba с 4 миллиардами. Большая модель занималась лишь обработкой запроса, оставляя генерацию текста для Qwen-3.5. По данным Mostik, это решение помогло сократить разрыв в качестве между моделями на 10 процентных пунктов при одинаковых вычислительных затратах.
Главный научный сотрудник Mostik Станислав Смирнов отметил, что внутренние состояния разных нейросетей сложно сопоставить напрямую. Даже для одинаковых задач модели могут использовать разные методы внутреннего кодирования информации. Смирнов считает, что изучение этих процессов может помочь лучше понять, как ИИ-системы представляют и обрабатывают данные.
Карл Туйлс, ранее работавший в Google DeepMind, подчеркнул, что большой потенциал новой методики заключается в возможности использования мощной модели только для обработки запроса, оставляя генерацию ответа для меньшей. Это позволяет объединять универсальные и специализированные модели, что может стать важным шагом в развитии узкоспециализированных систем.
Команда Mostik также интегрировала новый подход в набор задач ARC-AGI-3, где ИИ должен адаптироваться к новым правилам. По словам разработчиков, их система показала выдающиеся результаты, однако полноценные тесты еще продолжаются. Пока все результаты основываются на внутренних экспериментах Mostik и ждут подтверждения извне.