Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель научили возвращать программе готовый выбор и его вероятность, не генерируя текстовый ответ. Хотя препринт не прошёл рецензирование и все числа получили сами авторы, this-that-model-1.0 сократила задержку с 8758 до 30,9 мс. Такой интерфейс позволяет ставить модель на путь обработки каждого запроса, а не вызывать внешний сервис только для отдельных случаев.
Ответ ограничен вариантами ещё до запуска модели
this-that-model-1.0 — типизированная модель решений на 2 млрд параметров. Программа заранее передаёт ей состояние, вопрос и допустимые ответы: например, названия очередей, порядковую оценку или логическое значение.
Обычная LLM после обработки запроса начинает последовательно генерировать токены. Даже если от неё требуется одно слово, она может вернуть пояснение, разметку, отказ или оборванную строку. Приложению приходится разбирать результат и решать, что делать при ошибке: повторить запрос, запретить действие или пропустить его.
Новая модель не записывает ответ текстом. Она берёт скрытое состояние в заранее выделенной позиции, сопоставляет его только с объявленными вариантами и нормирует их оценки в распределение вероятностей. Ответ вне этого набора нельзя представить, поэтому отдельный разбор строки и ветка для неверного формата не нужны.
Несколько вопросов об одном состоянии обрабатываются за один проход. Ответы не добавляются обратно в запрос, поэтому модель не запускает новый цикл для каждого пункта. Для повторяющейся схемы — например, одинакового набора проверок для всех заявок — неизменяемую часть запроса можно вычислить заранее и повторно использовать с новыми данными.
Вероятности обучали с помощью перекрёстной энтропии и оценки Брайера. Последняя штрафует расхождение между заявленной вероятностью и фактическим исходом. Поэтому приложение может задать порог уверенности: принять очевидный вариант автоматически, а спорный передать другой модели или человеку.
Быстрый выбор не заменяет вычисление
На записанном сторонней командой наборе вопросов this-that-model-1.0 получила долю верных ответов 0,941, а hosted-сервис Jev — 0,765. Сравнение особенно полезно тем, что обе системы отвечали на одинаковые входные данные с исходными формулировками, которые создатели новой модели не выбирали.
Преимущество исчезает там, где ответ требует промежуточных шагов. На многошаговой арифметике результат модели составил 0,560 против 0,98 у сравниваемых внешних систем. Один проход хорошо распознаёт знакомую форму решения, но не хранит последовательность вычислений так, как это делает модель с генерацией рассуждения или отдельный алгоритм.
Тесты на пространственных задачах показали ту же границу. Модель научилась определять диапазон длины кратчайшего пути, но не смогла использовать ту же длину, когда вопрос переформулировали как проверку чётности. Она распознавала обученный класс, а не вычисляла значение, из которого можно получить разные ответы.
Точечное дополнительное обучение улучшило именно те семейства задач, ради которых его проводили, и не перенесло улучшение на остальные. Это делает специализацию управляемой, но не превращает небольшой классификатор в универсальную систему рассуждений.
Планы меняются только для ограниченных ветвлений
Работа предлагает не замену Claude, GPT или другим универсальным моделям, а другой компонент программы. Он подходит для веток, где набор исходов известен заранее: выбрать очередь обращения, проверить соответствие правилам, разрешить команду или оценить результат другого шага. Особенно заметен выигрыш, когда решение вызывается внутри цикла, данные нельзя отправлять наружу, а генерация текста не нужна продукту.
Сравнение с Jev охватывает 68 вопросов, поэтому его нельзя переносить на произвольные рабочие процессы. Более крупный выпущенный авторами набор содержит 7305 вопросов, но часть его форм задач использовали при обучении. Проверяли пространственные отношения, вероятностные действия, ограниченные ветвления и арифметику — не весь спектр решений, которые встречаются в продуктах.
Для внедрения понадобится собрать примеры именно своих веток и отдельно проверить вероятности на рабочих данных. Порог автоматического решения зависит от цены ошибки: одинаковая уверенность может быть приемлема для сортировки обращения и недостаточна для запуска команды. Если задача требует поиска по графу, последовательного расчёта или объяснения, её лучше оставить обычному коду либо генеративной модели.
Архитектурный вывод уже применим: если программе нужен один вариант из закрытого списка, текстовый API создаёт лишние операции. this-that-model-1.0 показывает, как убрать генерацию и разбор ответа, но качество такого компонента определяется тем, насколько точно команда очертила собственные типы решений.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



