Расшифровка встречи выдумала ответ, которого никто не давал

Если вы читаете расшифровки созвонов или протоколы встреч, сделанные программой, — эта статья про вас. Такие программы в паузах иногда дописывают слова, которых никто не произносил. И выглядят эти слова как настоящие.

КороткоПрограммы распознавания речи учились на огромном количестве записей из интернета с готовым текстом — судя по всему, в том числе на видео с субтитрами, где в тишине в конце стоят «Продолжение следует…» или «Спасибо за просмотр». Поэтому в паузах они иногда выдумывают текст, и на совещаниях, где пауз много, — особенно. Проверить свою программу можно за минуту: дайте ей полминуты тишины.

Вот три реплики из расшифровки настоящей встречи, которую мы разбирали. Встреча шла 81 минуту, все говорили по-русски.

Из расшифровки русскоязычной встречиSure. Merci. No, I don't know.

Никто из участников этого не говорил. Ни по-английски, ни по-французски. Эти слова написала программа, которая превращала звук в текст.

Теперь представьте последнюю фразу в протоколе вашего созвона с клиентом. «No, I don't know» — «Нет, я не знаю». Клиент отказался? Не в курсе дела? Вы перечитываете протокол через неделю, и у вас нет причин сомневаться: ответ стоит на своём месте, после вопроса, как настоящий.

Кого это касается

Если вы записываете созвоны и совещания и потом работаете с расшифровкой — касается напрямую. Неважно, откуда она: из Zoom, Телемоста, ИИ-помощника на встрече или отдельной программы.

Если вы коротко диктуете — сообщения, письма, заметки — почти нет. Выдумки появляются в паузах, а в короткой диктовке пауз мало.

Почему именно совещания? На созвоне много тишины: пока один говорит, остальные молчат, кто-то думает, кто-то ищет нужный файл. В одной разобранной нами записи созвона собеседников почти половину времени не было слышно. Половина записи — тишина, в которой программа может что-нибудь «услышать».

На чём работают расшифровки в Zoom или Телемосте, сервисы рассказывают не всегда. Поэтому узнать, выдумывает ли ваша, можно только опытом. Он ниже и занимает минуту.

Опыт: полминуты тишины

Чтобы убедиться, что дело именно в тишине, мы записали тридцать секунд, в которых нет ни одного звука — даже шороха. И дали эту запись программе распознавания речи Whisper. Её сделала компания OpenAI — та, что выпустила ChatGPT, — и раздаёт бесплатно, поэтому встроить её к себе может любой сервис. Встречу выше расшифровывала облачная версия этой же программы.

Вот что она написала на полной тишине:

Whisper, 30 секунд тишины, 5 октября 2026you you

Английское «you», дважды. Дважды — потому что наше приложение отдавало запись кусками по 15 секунд, и в каждом куске программа что-то «услышала». В записи, где нет ни звука.

Музей выдуманных фраз

Делая своё приложение, мы собрали коллекцию фраз, которые программа написала там, где никто не говорил. Вот несколько экспонатов:

Что программа писала на тишинеПродолжение следует... Спасибо за просмотр. Thank you for watching! Редактор субтитров [имя] Корректор [имя] Субтитры создавал [ник автора]

Имена и ники мы заменили: это настоящие люди, которые когда-то делали субтитры к видео. Они ни при чём.

Все экспонаты — это концовки видеороликов. В этом и разгадка.

Откуда они берутся

Представьте человека, который посмотрел десять тысяч сериалов. Экран гаснет, наступает тишина — и он машинально говорит: «Продолжение следует». Этих слов никто не произносил. Он просто знает, что после такой тишины обычно звучит именно это.

С программой, судя по всему, то же самое. Её учили на огромном количестве записей из интернета, к которым был готовый текст. Какой именно — разработчики не перечисляют. Но экспонаты говорят сами за себя: среди этих записей явно было много видео с субтитрами, где в тишине в конце стоит «Продолжение следует» или подпись автора субтитров. Программа запомнила связь «тишина — прощание» и в паузах воспроизводит её.

Отсюда и иностранные слова на русской встрече: короткие «Sure» или «Merci» — тоже частые реплики в чужих видео. Программа не слышит их, а угадывает.

Почему это опаснее обычной ошибки

Обычную ошибку распознавания видно сразу: «созван в зуме» вместо «созвон в Zoom», «Учаткт» вместо «у ChatGPT». Глаз спотыкается, вы поправляете.

Выдумка не спотыкается. «Спасибо, продолжение следует» в конце протокола выглядит как вежливое завершение встречи. «No, I don't know» после вопроса — как ответ. Текст гладкий, на своём месте, и именно поэтому его пропускают.

А дальше выдумка живёт своей жизнью. Если вы просите ИИ-помощника вроде ChatGPT составить итоги встречи по расшифровке, он честно включит в итоги и «отказ клиента», которого не было.

Проверьте свою программу за минуту

  1. Включите запись или диктовку и молчите тридцать секунд. Можно прикрыть микрофон ладонью.
  2. Если программа принимает файлы — дайте ей запись тишины или тихого шума.
  3. Посмотрите на результат. Программа, которая не выдумывает, вернёт пустоту. Слова, точки или вежливое прощание значат, что она дописывает на паузах.

Как не попасться в протоколе

  • Перечитывайте конец расшифровки. Прощания вроде «Спасибо за просмотр» и «Продолжение следует» — первые подозреваемые.
  • Ищите слова на чужом языке посреди русской речи: «Sure», «Okay», «Merci», «you».
  • Смотрите на места, где кто-то долго молчал. Короткая реплика на месте паузы — повод сверить с записью.
  • Не верьте ответу, которого никто не помнит. Если в протоколе кто-то «отказался», а участники этого не припоминают, — скорее всего, это выдумка.
  • Сверяйте итоги от ИИ-помощника с расшифровкой. Он пересказывает и выдумки тоже.

Мы делаем программу голосового ввода Doslovno. Модель, которой она распознаёт речь на компьютере, в нашей проверке на тишине молчала (подробности ниже) — но перечитывать важные расшифровки советуем и с ней.

Для дотошных: как мы проверяли и чего не знаем

Условия опыта с тишиной

Модель — Whisper large-v3 turbo в сборке WhisperKit (large-v3-v20240930_626MB), на Mac M3 Pro, язык — автоопределение. Запись нарезало наше приложение, кусками по 15 секунд, — отсюда два ответа на 30 секундах. Тишина — цифровой ноль 16 кГц, моно (ffmpeg -f lavfi -i anullsrc=r=16000:cl=mono -t 30). Отдельно давали шум — розовый с амплитудой 0,02 и бурый с амплитудой 0,05: на нём вместо слов программа ставила точки. Один прогон на каждый файл: это иллюстрация, а не статистика.

Механизм

По статье исследователей OpenAI, Whisper учили на 680 тысячах часов аудио из интернета, к которому в сети нашёлся текст. Его нарочно учили и на кусках без речи: на тишине модель должна предсказать особый знак «речи нет». Но это предсказание с вероятностью, а не правило. Декодер Whisper устроен как языковая модель — он генерирует текст, опираясь на звук, — и когда уверенности в «речи нет» не хватает, достраивает правдоподобное. Что среди обучающих записей были видео с субтитрами, в статье прямо не сказано — это наш вывод по самим выдумкам.

Parakeet, которым распознаёт Doslovno, — трансдьюсер: на каждый отрезок звука он решает, выдать ли следующий символ или «ничего». Одно из правдоподобных объяснений того, почему на тишине он молчит, — именно в этом устройстве. Проверить объяснение изнутри мы не можем.

Сравнение на тишине

МодельВыдумала текст
Whisper turbo6 из 6
Parakeet0 из 6

Наш замер 13 сентября 2026: шесть записей по 30 секунд — тишина, шум, музыка. Выборка маленькая, и это сравнение двух конкретных моделей в наших условиях, а не вывод «одна всегда лучше».

Встреча и паузы

«Почти половину времени не было слышно» — это 143 из 300 замеров громкости потока собеседников, оказавшихся ниже порога слышимости, на разобранной записи созвона. Ниже порога — не значит цифровой ноль: там могли быть шум и эхо. Реплики «Sure», «Merci», «No, I don't know» — из разбора встречи на 81 минуту, 13 августа 2026; распознавание в ней шло через облачный Whisper с автоопределением языка.

А если просто вырезать тишину?

В нашем замере вырезание тишины перед распознаванием ухудшило точность на 7,9 процентного пункта, а вместе с автоматической регулировкой громкости — на 8,8. Почему — точно не знаем: возможно, вырезалка задевала края слов. Это результат нашей обработки, а не закон: аккуратное вырезание с запасом по краям у других может работать иначе.

Ловушка фильтров

Список известных выдумок помогает, но грубый фильтр опасен. «Продолжение следует из первого пункта» — настоящая фраза, её может сказать человек. Поэтому наш фильтр вычищает выдумку, только когда она стоит отдельной фразой — даже приклеенная в конец настоящего текста, — а внутри живого предложения оставляет. На это у нас отдельные проверки в коде.

Вопросы

Почему в расшифровке встречи появилась фраза, которую никто не говорил?

Программа, которая превращает речь в текст, в паузах иногда выдумывает слова. Судя по всему, дело в том, на чём её учили: на записях из интернета с готовым текстом, где после тишины часто стоят типичные фразы. На созвонах пауз много — пока один говорит, остальные молчат.

Почему в конце расшифровки написано «Продолжение следует» или «Спасибо за просмотр»?

Это не расслышанные слова, а выдумка программы. Такие фразы типичны для концовок видео с субтитрами, и программа воспроизводит их на тишине. Их можно смело удалять.

Что значит «Субтитры создавал…» в расшифровке?

Это подпись автора субтитров к какому-то видео из интернета. Программа, судя по всему, много раз встречала её при обучении и выдаёт на тишине. Такую строку можно удалить.

Как проверить, выдумывает ли моя программа текст?

Включите запись и помолчите полминуты, прикрыв микрофон ладонью. Если программа принимает файлы, дайте ей запись тишины. Программа, которая не выдумывает, вернёт пустоту. Если появились слова, точки или прощания — она дописывает на паузах.

Грозит ли это, если я просто диктую короткие сообщения?

Почти нет: в короткой диктовке пауз мало. Сильнее всего выдумки проявляются в длинных записях с молчанием — на созвонах и совещаниях.