Журнал · Rit.work

MetroLLM-Bench: Qwen 3.5 4B сравнялась с GPT в роли транзитного киоска

MetroLLM-Bench показывает, как небольшая дообученная Qwen выполняет проверяемые операции киоска на уровне крупных закрытых моделей и помещается в 2,6 ГБ.

Rit.work
Студия разработки
10 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Небольшую открытую модель научили управлять транзитным киоском: строить маршрут, рассчитывать тариф и реагировать на сбои. На отложенной выборке Qwen 3.5 4B сравнялась по исполняемым требованиям с GPT-5.4 full и обеими конфигурациями GPT-5.6. Это делает локальный запуск реальной альтернативой API для узкой задачи, хотя препринт Remco Hendriks из Continker не рецензирован и все числа в нём получил сам автор.

Киоск оценивают по итоговому действию, а не по тексту ответа

MetroLLM-Bench состоит из 955 сценариев для шести реальных систем метро. В них входят обычные поездки, изменения тарифов, закрытия станций, требования доступности, многоходовые диалоги, временные ограничения и попытки заставить модель нарушить правила.

Модель получает описание конкретной транспортной системы: терминологию, часы работы, валюту и локальные правила. Она не должна вспоминать устройство сети из обучающих данных. Все нужные сведения приходят через системное описание и шесть структурированных инструментов, среди которых планировщик маршрута, калькулятор тарифа и лента сбоев.

Ответом служит не свободный текст, а состояние, которое может отрисовать и исполнить киоск. Модель выбирает исход операции, указывает маршрут и стоимость билетов, добавляет сообщение пассажиру и решает, разрешить ли покупку. Если структура не проходит проверку, среда возвращает ошибку по конкретным полям, и модель может исправить результат.

Первый уровень оценки полностью детерминирован. Он проверяет маршрут, тариф, вызовы инструментов, структуру состояния, выбранное действие и реакцию на сбой. Второй уровень оценивает смысл и качество сообщения: соблюдение правил, безопасность, доступность и отсутствие выдуманных данных; часть этих критериев проверяет модель-оценщик.

Для основного сравнения до обучения отделили 238 сценариев. Поэтому дообученные модели не видели сами проверочные примеры, хотя часть из них использует те же шаблоны и пары типов событий, что и обучающая часть.

Дообучение помогло младшей модели, но не старшим

Для Qwen применили параметрически эффективное дообучение (PEFT): базовые веса почти не меняются, а задача записывается в небольшой набор дополнительных параметров. Учебные примеры отобрали из успешных трасс более крупной модели, где были сохранены вызовы инструментов и итоговое состояние киоска.

Модель с 4B параметров набрала 91,3 балла на детерминированном уровне. Она формально обошла обе конфигурации GPT-5.6 и практически совпала с GPT-5.4 full, получившей 91,4 балла. Сама методика не позволяет считать разницу меньше одного балла доказанным преимуществом, поэтому корректный вывод здесь — равенство на целевой задаче, а не победа Qwen над GPT.

Две более крупные дообученные версии результат не улучшили. У самой старшей адаптация даже снизила оценку относительно базовой модели. Это не значит, что меньшие LLM в целом лучше: эффект относится к конкретному набору трасс, настройкам обучения и ограниченному контракту киоска.

Скриптовый агент без LLM справлялся с маршрутизацией и арифметикой тарифа. Языковая модель добавляла ценность там, где требовалось применить изменившееся правило, совместить несколько условий, учесть доступность или правильно интерпретировать время. На совокупной оценке, куда входит смысловое качество сообщений, лидировала Muse Glimmer 30B, а дообученная Qwen уступила закрытым моделям в части сложных временных и провокационных сценариев.

Планы меняются для узких процессов с проверяемым контрактом

Работа поддерживает архитектуру, в которой LLM не рассчитывает тариф и не ищет путь самостоятельно. Эти операции остаются в детерминированных сервисах, а модель выбирает инструменты, применяет меняющиеся правила и собирает допустимое конечное состояние. Так ошибки проще обнаруживать, а действия — разбирать после инцидента.

Для такого контура необязательно начинать с крупного закрытого API. Квантованный файл дообученной модели занимает 2,6 ГБ, тогда как старшая версия — 16 ГБ без измеримого выигрыша на первом уровне. Это позволяет проверить локальный запуск на обычной инфраструктуре и сохранить веса, запросы и журналы вызовов внутри системы оператора.

Практический порядок выглядит так: сначала описать машинно проверяемый контракт, вынести точные вычисления в инструменты и собрать собственные сценарии с изменениями правил. Затем стоит сравнить скриптовую основу, базовую LLM и дообученную малую модель на заранее отделённой выборке. Выбирать размер по общим рейтингам до такой проверки невыгодно: в этой работе дополнительная ёмкость после достижения потолка задачи ничего не дала.

Результат относится к короткому процессу с фиксированным набором инструментов и ограниченным состоянием на выходе. Сценарии спроектированы для бенчмарка, а не собраны из эксплуатации; работа не проверяет длинные цепочки действий, открытый доступ к внешним системам и свободные диалоги. Поэтому переносить равенство с GPT на универсальных агентов или поддержку пассажиров без жёсткого контракта нельзя.

Источники

Иллюстрация: рисунок из статьи «MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes», Remco Hendriks (Continker), CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу