Журнал · Rit.work

HARISSA проверяет ответы локальной LLM без облака

HARISSA использует скрытые состояния локальной LLM, чтобы выбирать глубину вычислений, отбрасывать сомнительные ответы и передавать сложные запросы человеку.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Локальную языковую модель научили решать, когда отвечать сразу, когда тратить время на рассуждение, а когда передавать запрос человеку. В препринте University of Michigan и SNU-LG AI Research Center, который не прошёл рецензирование и содержит замеры самих авторов, HARISSA удержала точность в пределах одного процентного пункта от постоянной цепочки рассуждений, но снизила задержку в 2,7 раза. Такой подход позволяет сохранить данные внутри инфраструктуры, не оплачивая одинаково дорогую обработку каждого запроса.

Как модель проверяет себя до и после ответа

HARISSA принимает решения по скрытым состояниям — внутренним числовым представлениям, которые модель вычисляет при обработке текста. Система читает два состояния: после загрузки запроса, но до генерации, и после последнего токена готового ответа.

Первое состояние показывает, справится ли выбранный способ ответа. Если вероятность успеха низкая, система пропускает его и переходит к более дорогому варианту: например, включает рассуждение или запускает более крупный размер той же модели. Это экономит время, потому что заведомо слабый вариант не генерирует ответ целиком.

Второе состояние оценивает уже созданный ответ. Если уверенности достаточно, HARISSA возвращает его пользователю. Иначе система пробует следующий вариант, а после последней попытки либо показывает результат, либо передаёт запрос человеку.

Перед внедрением модель дообучают через LoRA. Каждый доступный способ отвечает на размеченные запросы, после чего правильность ответов становится учебным сигналом для двух линейных классификаторов. Пороговые значения настраивают отдельно под стоимость задержки, ошибочного ответа и передачи человеку.

При работе HARISSA не вызывает вторую модель и не просит основную модель объяснять собственную уверенность отдельным текстом. Проверка сводится к чтению уже вычисленных состояний и скалярному произведению, поэтому сама по себе не добавляет измеримой задержки.

Где скрытые состояния помогли сэкономить вычисления

На условном устройстве авторы запускали Qwen 3.5 4B в двух режимах: прямой ответ и ответ с рассуждением. На сервере HARISSA выбирала между несколькими размерами той же семьи. Проверку провели на MedQA, MedMCQA и части BBH с заданиями множественного выбора.

На устройстве система сначала генерировала короткий прямой ответ, а к рассуждению переходила только тогда, когда проверка готового результата находила риск ошибки. Это существенно для интерактивных сценариев: постоянное рассуждение на MedQA занимало 81 секунду на запрос даже на серверной GPU.

На сервере больше пользы принесла проверка до генерации. HARISSA могла сразу пропустить слабый размер модели, тогда как FrugalGPT и Self-REF сначала получали от него полный ответ и лишь затем решали, переходить ли дальше. При одинаковой задержке HARISSA оказалась точнее обеих каскадных схем.

Проверка готового ответа также лучше отделяла ошибки, чем вероятность всей последовательности, разрыв между наиболее вероятными вариантами ответа и уверенность Self-REF. При одинаковой доле запросов, переданных человеку, она оставляла меньше неверных ответов в пяти из шести сочетаний задач и условий.

Все результаты относятся к заданиям с выбором ответа. Задержку рассчитывали по числу токенов и скорости, измеренной на NVIDIA A40, а пороги выбирали на отдельной части каждого датасета. Это проверяет сам механизм каскада, но не заменяет замеры на целевом устройстве и рабочих запросах продукта.

Работа меняет архитектурный план, но не даёт готового компонента

Для локального продукта HARISSA предлагает полезную границу между маршрутизацией и контролем качества. Система не обязана отправлять сложный запрос в облако: она может сначала увеличить локальные вычисления, а затем остановиться и привлечь человека, если все доступные варианты выглядят ненадёжно.

Такой контур стоит учитывать при выборе модели. Команде нужен доступ к её скрытым состояниям, возможность дообучения и несколько способов ответа с разной стоимостью. Закрытый API, который возвращает только текст и вероятности токенов, для этого метода не подходит.

Понадобится и собственный набор размеченных запросов. HARISSA учится предсказывать не абстрактную сложность вопроса, а вероятность того, что конкретная модель с конкретным режимом ответит правильно. Поэтому перенос готовых классификаторов между доменами противоречит самой логике метода.

Главное практическое следствие — передачу человеку следует проектировать вместе с управлением вычислениями, а не добавлять после запуска. Один порог определяет, стоит ли пробовать более дорогой вариант, другой — можно ли показывать результат. Их следует настраивать по реальной цене ожидания, ошибки и нагрузки на специалистов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу