Журнал · Rit.work

Биологические LLM могут игнорировать данные, ради которых их обучали

Тест шести биологических LLM показал: высокая точность не гарантирует, что модель использует последовательности ДНК, белков и данные клеток, а не опирается на текстовые аннотации.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Высокая точность биологических LLM не гарантирует, что они учитывают данные о ДНК, белках или клетках. В работе Harvard University и MIT, которая не проходила рецензирование и содержит замеры самих авторов, BioReason и BioReason-Pro при конфликте входов следовали текстовым аннотациям в 97,9% и 99,7% случаев. Поэтому обычный тест на правильность ответов не показывает, действительно ли подключённая биологическая модель влияет на результат.

Для проверки один вход меняли, а запрос и остальные данные оставляли прежними. Также модели давали противоречивые свидетельства: числовое представление одного генома, белка или клетки сочетали с текстом о другом объекте. Затем исследователи проверяли, можно ли извлечь правильный ответ из представления простым линейным классификатором, и сопоставляли объяснения LLM с поданными данными.

Перемешивание ДНК не изменило долю правильных ответов BioReason: она осталась на уровне 0,847. При этом классификаторы извлекали целевые признаки из представлений Evo2 и ESM3. Значит, биологические модели кодировали полезную информацию, но подключённые к ним LLM почти не использовали её и предпочитали готовые текстовые сведения о генах, путях и функциях белков.

Так происходило не во всех системах. Представления биологических моделей влияли на ответы ChatNT, Prot2Text-V2 и CellWhisperer, а Cell2Sentence-Scale учитывала гены с различающейся активностью. У BioReason рост точности на 42 контрольных точках обучения не сопровождался более активным использованием Evo2. Сгенерированные объяснения тоже не служили надёжной проверкой: модель могла неверно описать замену нуклеотида или упомянуть функцию, которая не попадала в итоговый прогноз.

Проверка охватила шесть моделей и конкретные задачи для ДНК, белков и одиночных клеток: прогноз болезней и функций, распознавание участков последовательности и определение типа клетки. Перемешивание создаёт неестественные последовательности, однако конфликты между неизменёнными входами дали тот же вывод. При выборе архитектуры к итоговой точности стоит добавлять тесты, где меняется только биологический вход: иначе интеграция может существовать технически, но почти не влиять на решение.

Источники

Иллюстрация: рисунок из статьи «When Do Biological Reasoning Models Use Their Biological Inputs?», Ada Fang, Nikitha Thoduguli, Lukas Fesser и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу