Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Потоковую аудиовизуальную модель научили не превращать раннюю догадку в факт, пока звук или видео ещё не дали проверяемого подтверждения. В нерецензированном препринте, где все числа получили сами авторы, OST превзошёл сильнейшие открытые аналоги более чем на 10% относительно в среднем. Для потоковых продуктов это предлагает архитектурный способ исправлять не только ошибочный вывод, но и память, построенную на нём.
Почему позднее опровержение не исправляет раннюю ошибку
Звук и изображение раскрывают смысл с разной скоростью. Несколько кадров уже показывают предмет или надпись, тогда как реплика, объявление или период тишины становятся понятны только после завершения.
В примере из работы экран аэропорта показывает Gate 6, но начавшееся объявление меняет выход на Gate 12. Обычная потоковая модель успевает записать первое значение в память. Следующие промежуточные выводы используют эту запись как основание, поэтому завершившееся объявление конкурирует уже не с одной догадкой, а с цепочкой согласованных состояний.
Авторы называют это преждевременным межмодальным выводом. Проблема возникает не только при распознавании сигнала: модель может правильно разобрать звук отдельно, но проигнорировать его рядом с убедительной визуальной подсказкой. Простая повторная проверка последнего ответа здесь не помогает, потому что устаревшее предположение продолжает влиять через память.
Как утверждение связывают с будущей проверкой
OST хранит неоднозначную интерпретацию как неподтверждённое утверждение. Запись содержит ожидаемое событие, канал для проверки, окно времени и ссылки на части состояния, которые используют эту догадку. В примере с аэропортом модель сохраняет предположение, что объявление подтвердит Gate 6, но не считает его установленным фактом.
Поток делится на отрезки по четыре секунды. Когда окно проверки закрывается, отдельный проверяющий компонент обращается только к подходящему свидетельству: звуку, изображению или их паре. Он подтверждает утверждение, опровергает его либо оставляет нерешённым.
Для этого OST раздельно хранит звуковые и визуальные данные. Непроверенный временной отрезок нельзя вытеснить из памяти более плотным потоком кадров, пока связанное с ним утверждение не получит вердикт. Такое разделение важно: проверка бесполезна, если нужный фрагмент звука уже удалён ради новых визуальных признаков.
При опровержении модель снижает надёжность исходной записи и всех состояний, которые от неё зависят. Эти связи образуют направленный граф происхождения выводов. Затем OST заново формирует текущее состояние с учётом нового свидетельства, а ослабленные записи получают меньше внимания при дальнейшей генерации.
Последний элемент — затвор ответа. Он не выпускает результат, пока критичное для него утверждение ожидает запланированной проверки. Если поток заканчивается раньше, модель всё же отвечает, но отмечает вывод с нерешённой опорой как ответ с низкой уверенностью.
Когда подход меняет архитектуру продукта
OST проверили на замороженной Qwen3-Omni-30B-A3B-Instruct с обучаемыми облегчёнными адаптерами. В набор вошли пять потоковых и аудиовизуальных тестов: SOVBench, StreamingBench, Video-Holmes, Daily-Omni и OmniVideoBench. Поэтому результат относится к одной базовой модели и задачам, где синхронизированные звук и видео поступают частями.
Отдельный OST-DiagBench удерживает изображение неизменным, но удаляет, заменяет или дополняет звук, а также сталкивает изменённую речь со старым текстом в кадре. Это отделяет настоящее использование звука от ответа по визуальной подсказке. OST получил различимость d′ 2,95 против не более 1,38 у открытых аналогов: показатель растёт, когда система увереннее отличает присутствующий звук от визуально подсказанного, но отсутствующего.
Самая наглядная проверка — Clash, где произнесённый факт меняют, а прежнее значение оставляют в субтитре. Точность OST составила 46,47 против максимальных 4,90 у открытых аналогов. Результат показывает, что проверка влияет не только на распознавание звука, но и на выбор между противоречащими каналами.
Для команды, которая строит потоковую систему с накопительной памятью, работа меняет план в одном месте: гипотезы стоит хранить не как текстовые факты, а как записи со сроком проверки, владельцем-каналом и зависимостями. Тогда исправление можно протянуть через промежуточные выводы, а выдачу ответа связать с состоянием этих проверок.
Это не замена базовой модели и не дополнительная фраза в запросе. Потребуются раздельное хранение сигналов, структурированная память, проверяющий компонент, граф зависимостей и обучение затвора ответа. Подход оправдан прежде всего там, где система должна отвечать до конца потока и где поздний сигнал способен отменить раннюю интерпретацию.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



