Журнал · Rit.work

Когда клинической LLM стоит передать арифметику исполнителю

Локальный исполнитель Python повысил точность старшей Qwen, но не дал надёжного преимущества младшей модели и не заменил проверенные клинические калькуляторы.

Rit.work
Студия разработки
12 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Клиническая языковая модель точнее решает задачи с калькуляторами, когда не считает сама. Работа MIT Critical Data, UNC Chapel Hill, University of Pavia и Humanitas University показывает прирост на 7,05 процентного пункта у старшей Qwen, хотя препринт не рецензировали, а все числа получили сами авторы. Результат поддерживает архитектуру с отдельным вычислителем, но не обещает одинаковой пользы для любой LLM.

Модель пишет программу, а не итоговое число

Обычная LLM должна выбрать формулу, найти показатели в медицинской записи и выполнить вычисления внутри ответа. Ошибка на любом этапе меняет результат калькулятора, а вместе с ним — рекомендацию врачу.

В предложенной схеме модель получает текст записи, формулу и эталонные значения переменных. Затем она пишет короткую программу на Python. Локальный исполнитель запускает её и возвращает число, дату или срок беременности. При одинаковой программе и входных данных вычисление даёт одинаковый результат, поэтому арифметика больше не зависит от генерации следующего токена.

Исполнитель разрешает только несколько стандартных модулей и запускает каждую программу в отдельном процессе с ограничениями по памяти, времени и числу выполненных строк. Он запрещает доступ к файлам и динамический запуск кода. При этом полноценной изолированной средой его считать нельзя: в эксперименте не использовали контейнер и фильтр системных вызовов.

Схему проверяли на MedCalc-Bench Verified: 1 100 клинических случаев для 55 калькуляторов. Основные эксперименты провели с Qwen2.5-7B-Instruct и Qwen2.5-32B-Instruct-AWQ. Модель с исполнителем и модель с обычной арифметикой получали одну формулу, одни переменные и полный текст записи, поэтому сравнение отделяет эффект выполнения кода от качества поиска исходных данных.

Старшая Qwen выиграла, младшая осталась в пределах погрешности

На старшей Qwen исполнитель дал точность 90,53% против 83,47% при вычислении внутри ответа. Разница оказалась статистически значимой. На младшей Qwen преимущество было меньше и укладывалось в погрешность, поэтому сам переход к Python не гарантирует улучшения.

Дополнительные проверки на Mistral и Phi-3.5 дали противоположные результаты: одной модели генерация кода мешала, другой помогала. По размеру модели пока нельзя предсказать, окупится ли такой исполнитель. Команде придётся сравнивать оба маршрута на выбранной модели и своих формулах.

Сбой также не исчезает, а перемещается. Модель может написать синтаксически неверную программу, придумать преобразование единиц или выбрать соседний диапазон в таблице баллов. Исполнитель точно выполняет полученный код, но не определяет, правильно ли код выражает медицинское правило.

Проверка охватывала англоязычные записи с американскими форматами дат и единиц. Другие языки, локальные соглашения и работу с ранее не встречавшимися формулами не оценивали. Стоимость локального запуска моделей на GPU тоже не измеряли.

Проверенные функции остаются первым маршрутом

Ручная библиотека дала точный ответ на всех 440 поддерживаемых случаях, но обслуживала только 40% набора и отказывалась отвечать на остальных. Генерация программы выигрывает у неё прежде всего охватом: модель пытается применить любую переданную формулу. Там, где готовая функция уже существует, она надёжнее сгенерированного кода.

Для продукта из этого следует трёхступенчатая схема. Сначала запрос идёт в проверенную функцию для известного калькулятора. Если её нет, LLM переводит явно заданную формулу в программу для ограниченного исполнителя. Если формула, версия или входные значения вызывают сомнение, система отказывается от ответа вместо попытки угадать.

Такой порядок важен ещё и потому, что точное вычисление не подтверждает клиническую актуальность формулы. При аудите набора обнаружились калькуляторы со спорными коэффициентами, версиями и условиями применения. Бенчмарк засчитывает совпадение со своим эталоном, даже когда более новая рекомендация уже заменила исходную формулу.

Поэтому в рабочей системе нужно хранить вместе с формулой её версию, источник и область применения, а результат программы проверять по типу и допустимому диапазону. Локальный запуск помогает не передавать медицинский текст во внешний API, но требует отдельной защиты среды исполнения, журналирования и контроля ресурсов.

Работа не обосновывает полный отказ от ручных калькуляторов. Она показывает более узкую границу: вынесенная арифметика может повысить точность конкретной LLM, если формула и переменные уже известны. Ошибки выбора формулы, извлечения показателей и клинической проверки эта архитектура не исправляет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу