Журнал · Rit.work

Jev принимает типовые решения без генерации текста и обходит открытые LLM

Jev выбирает готовый ответ и оценивает его вероятность: в тестах модель опередила Qwen на большинстве наборов, но потребовала настройки порогов для бинарных решений.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Специализированная модель Jev научилась принимать короткие типовые решения без генерации текста: выбирать вариант, ставить оценку по шкале или возвращать вероятность ответа «да». В препринте, который не рецензировали и числа для которого получили сами авторы, Jev обошла Qwen3.8-27B на 27 из 37 наборов данных и Gemma-4-E4B — на всех.

Вместо запроса на естественном языке Jev получает состояние и типизированный вопрос с допустимыми ответами. Такой интерфейс подходит для маршрутизации обращений, проверки утверждений по источнику, модерации и выставления оценки по заданным критериям. Системе не нужно извлекать ответ из сгенерированного текста, а несколько вопросов к одному состоянию она обрабатывает за один запрос.

Вероятности вариантов оказались достаточно точно согласованы с реальной долей ошибок. Это позволяет задать порог уверенности: принимать надёжные ответы автоматически, а сомнительные отправлять другой модели или человеку. Для бинарных решений универсальный порог 0,5 работал хуже: после настройки порогов на обучающих примерах F1-мера на UNFAIR-ToS выросла с 0,50 до 0,75.

Проверка охватила классификацию, маршрутизацию, понимание текста, модерацию, юридические формулировки и оценку по шкале. Все модели отвечали без примеров и рассуждений, по одному зафиксированному шаблону на набор. Jev достигла точности 95–99% на IMDB, SST-2, HellaSwag и ARC, но ошибалась чаще на языках с малым объёмом обучающих данных, неоднозначных метках и оценке качества сгенерированного текста.

Авторы отправили 346 009 запросов менее чем за 10 долларов. Это делает Jev кандидатом для массовых узких проверок внутри конвейера, но сравнение не показывает, как она выглядит на фоне LLM с включённым рассуждением. Необычно высокий результат на вычислительных вопросах MMLU также нельзя окончательно отделить от возможного попадания пар «вопрос — ответ» в обучающие данные.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу