Журнал · Rit.work

K-Bench отделил поддержку в ответах LLM от работы с риском

K-Bench сравнивает LLM в многоходовых разговорах о психическом здоровье и показывает, почему общий балл не заменяет отдельную проверку работы с риском.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился способ сравнивать LLM в диалогах, где риск самоубийства, самоповреждения, домашнего насилия или злоупотребления веществами раскрывается постепенно. Разрыв между конфигурациями по работе с риском достиг почти 44 пунктов, хотя препринт не рецензирован, а числа получили сами авторы. Для продукта это меняет тестирование: убедительный и поддерживающий ответ ещё не означает, что модель вовремя уточнит опасные детали.

K-Bench проводит каждую конфигурацию через одни и те же 200 сценариев длиной до 20 реплик с каждой стороны. Синтетический пациент может сообщать о риске косвенно, повышать его тяжесть и сочетать несколько угроз; оценка отдельно учитывает распознавание риска, уточняющие вопросы, этику, психологические знания, границы и качество поддержки.

Ответы проверяет зафиксированная версия GPT-4o, откалиброванная по оценкам клиницистов. На 151 размеченном диалоге модель-оценщик совпала с итоговым мнением специалистов в 94,2% подходящих сравнений. Рабочие сценарии, расписание раскрытия деталей и примеры выставления баллов закрыты, чтобы будущие модели нельзя было напрямую подогнать под тест.

В рейтинг вошли 125 конфигураций на базе 33 моделей. Конфигурацией считается сочетание версии модели, системного промпта и режима рассуждения. Лучшие системы набрали близкие общие баллы, но сильнее различались в том, задают ли они вопросы, необходимые для оценки ситуации.

Терапевтический промпт не дал универсального улучшения: у одной слабой конфигурации итог по работе с риском вырос на 17,91 пункта, а у другой снизился на 6,09. Усиленный режим рассуждения в среднем тоже не помог. K-Bench проверяет поведение в синтетических разговорах, а не клинический эффект продукта; сходство с человеческими диалогами отдельно оценивали только на сценариях без риска.

Источники

Иллюстрация: рисунок из статьи «K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations», Laura M. Vowels, Matthew J. Vowels, Shivali Sharma и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу