Расшифровка встречи выдумала ответ, которого никто не давал
Если вы читаете расшифровки созвонов или протоколы встреч, сделанные программой, — эта статья про вас. Такие программы в паузах иногда дописывают слова, которых никто не произносил. И выглядят эти слова как настоящие.
Вот три реплики из расшифровки настоящей встречи, которую мы разбирали. Встреча шла 81 минуту, все говорили по-русски.
Никто из участников этого не говорил. Ни по-английски, ни по-французски. Эти слова написала программа, которая превращала звук в текст.
Теперь представьте последнюю фразу в протоколе вашего созвона с клиентом. «No, I don't know» — «Нет, я не знаю». Клиент отказался? Не в курсе дела? Вы перечитываете протокол через неделю, и у вас нет причин сомневаться: ответ стоит на своём месте, после вопроса, как настоящий.
Кого это касается
Если вы записываете созвоны и совещания и потом работаете с расшифровкой — касается напрямую. Неважно, откуда она: из Zoom, Телемоста, ИИ-помощника на встрече или отдельной программы.
Если вы коротко диктуете — сообщения, письма, заметки — почти нет. Выдумки появляются в паузах, а в короткой диктовке пауз мало.
Почему именно совещания? На созвоне много тишины: пока один говорит, остальные молчат, кто-то думает, кто-то ищет нужный файл. В одной разобранной нами записи созвона собеседников почти половину времени не было слышно. Половина записи — тишина, в которой программа может что-нибудь «услышать».
На чём работают расшифровки в Zoom или Телемосте, сервисы рассказывают не всегда. Поэтому узнать, выдумывает ли ваша, можно только опытом. Он ниже и занимает минуту.
Опыт: полминуты тишины
Чтобы убедиться, что дело именно в тишине, мы записали тридцать секунд, в которых нет ни одного звука — даже шороха. И дали эту запись программе распознавания речи Whisper. Её сделала компания OpenAI — та, что выпустила ChatGPT, — и раздаёт бесплатно, поэтому встроить её к себе может любой сервис. Встречу выше расшифровывала облачная версия этой же программы.
Вот что она написала на полной тишине:
Английское «you», дважды. Дважды — потому что наше приложение отдавало запись кусками по 15 секунд, и в каждом куске программа что-то «услышала». В записи, где нет ни звука.
Музей выдуманных фраз
Делая своё приложение, мы собрали коллекцию фраз, которые программа написала там, где никто не говорил. Вот несколько экспонатов:
Имена и ники мы заменили: это настоящие люди, которые когда-то делали субтитры к видео. Они ни при чём.
Все экспонаты — это концовки видеороликов. В этом и разгадка.
Откуда они берутся
Представьте человека, который посмотрел десять тысяч сериалов. Экран гаснет, наступает тишина — и он машинально говорит: «Продолжение следует». Этих слов никто не произносил. Он просто знает, что после такой тишины обычно звучит именно это.
С программой, судя по всему, то же самое. Её учили на огромном количестве записей из интернета, к которым был готовый текст. Какой именно — разработчики не перечисляют. Но экспонаты говорят сами за себя: среди этих записей явно было много видео с субтитрами, где в тишине в конце стоит «Продолжение следует» или подпись автора субтитров. Программа запомнила связь «тишина — прощание» и в паузах воспроизводит её.
Отсюда и иностранные слова на русской встрече: короткие «Sure» или «Merci» — тоже частые реплики в чужих видео. Программа не слышит их, а угадывает.
Почему это опаснее обычной ошибки
Обычную ошибку распознавания видно сразу: «созван в зуме» вместо «созвон в Zoom», «Учаткт» вместо «у ChatGPT». Глаз спотыкается, вы поправляете.
Выдумка не спотыкается. «Спасибо, продолжение следует» в конце протокола выглядит как вежливое завершение встречи. «No, I don't know» после вопроса — как ответ. Текст гладкий, на своём месте, и именно поэтому его пропускают.
А дальше выдумка живёт своей жизнью. Если вы просите ИИ-помощника вроде ChatGPT составить итоги встречи по расшифровке, он честно включит в итоги и «отказ клиента», которого не было.
Проверьте свою программу за минуту
- Включите запись или диктовку и молчите тридцать секунд. Можно прикрыть микрофон ладонью.
- Если программа принимает файлы — дайте ей запись тишины или тихого шума.
- Посмотрите на результат. Программа, которая не выдумывает, вернёт пустоту. Слова, точки или вежливое прощание значат, что она дописывает на паузах.
Как не попасться в протоколе
- Перечитывайте конец расшифровки. Прощания вроде «Спасибо за просмотр» и «Продолжение следует» — первые подозреваемые.
- Ищите слова на чужом языке посреди русской речи: «Sure», «Okay», «Merci», «you».
- Смотрите на места, где кто-то долго молчал. Короткая реплика на месте паузы — повод сверить с записью.
- Не верьте ответу, которого никто не помнит. Если в протоколе кто-то «отказался», а участники этого не припоминают, — скорее всего, это выдумка.
- Сверяйте итоги от ИИ-помощника с расшифровкой. Он пересказывает и выдумки тоже.
Мы делаем программу голосового ввода Doslovno. Модель, которой она распознаёт речь на компьютере, в нашей проверке на тишине молчала (подробности ниже) — но перечитывать важные расшифровки советуем и с ней.
Для дотошных: как мы проверяли и чего не знаем
Условия опыта с тишиной
Модель — Whisper large-v3 turbo в сборке WhisperKit (large-v3-v20240930_626MB), на Mac M3 Pro, язык — автоопределение. Запись нарезало наше приложение, кусками по 15 секунд, — отсюда два ответа на 30 секундах. Тишина — цифровой ноль 16 кГц, моно (ffmpeg -f lavfi -i anullsrc=r=16000:cl=mono -t 30). Отдельно давали шум — розовый с амплитудой 0,02 и бурый с амплитудой 0,05: на нём вместо слов программа ставила точки. Один прогон на каждый файл: это иллюстрация, а не статистика.
Механизм
По статье исследователей OpenAI, Whisper учили на 680 тысячах часов аудио из интернета, к которому в сети нашёлся текст. Его нарочно учили и на кусках без речи: на тишине модель должна предсказать особый знак «речи нет». Но это предсказание с вероятностью, а не правило. Декодер Whisper устроен как языковая модель — он генерирует текст, опираясь на звук, — и когда уверенности в «речи нет» не хватает, достраивает правдоподобное. Что среди обучающих записей были видео с субтитрами, в статье прямо не сказано — это наш вывод по самим выдумкам.
Parakeet, которым распознаёт Doslovno, — трансдьюсер: на каждый отрезок звука он решает, выдать ли следующий символ или «ничего». Одно из правдоподобных объяснений того, почему на тишине он молчит, — именно в этом устройстве. Проверить объяснение изнутри мы не можем.
Сравнение на тишине
| Модель | Выдумала текст |
|---|---|
| Whisper turbo | 6 из 6 |
| Parakeet | 0 из 6 |
Наш замер 13 сентября 2026: шесть записей по 30 секунд — тишина, шум, музыка. Выборка маленькая, и это сравнение двух конкретных моделей в наших условиях, а не вывод «одна всегда лучше».
Встреча и паузы
«Почти половину времени не было слышно» — это 143 из 300 замеров громкости потока собеседников, оказавшихся ниже порога слышимости, на разобранной записи созвона. Ниже порога — не значит цифровой ноль: там могли быть шум и эхо. Реплики «Sure», «Merci», «No, I don't know» — из разбора встречи на 81 минуту, 13 августа 2026; распознавание в ней шло через облачный Whisper с автоопределением языка.
А если просто вырезать тишину?
В нашем замере вырезание тишины перед распознаванием ухудшило точность на 7,9 процентного пункта, а вместе с автоматической регулировкой громкости — на 8,8. Почему — точно не знаем: возможно, вырезалка задевала края слов. Это результат нашей обработки, а не закон: аккуратное вырезание с запасом по краям у других может работать иначе.
Ловушка фильтров
Список известных выдумок помогает, но грубый фильтр опасен. «Продолжение следует из первого пункта» — настоящая фраза, её может сказать человек. Поэтому наш фильтр вычищает выдумку, только когда она стоит отдельной фразой — даже приклеенная в конец настоящего текста, — а внутри живого предложения оставляет. На это у нас отдельные проверки в коде.
Вопросы
Почему в расшифровке встречи появилась фраза, которую никто не говорил?
Программа, которая превращает речь в текст, в паузах иногда выдумывает слова. Судя по всему, дело в том, на чём её учили: на записях из интернета с готовым текстом, где после тишины часто стоят типичные фразы. На созвонах пауз много — пока один говорит, остальные молчат.
Почему в конце расшифровки написано «Продолжение следует» или «Спасибо за просмотр»?
Это не расслышанные слова, а выдумка программы. Такие фразы типичны для концовок видео с субтитрами, и программа воспроизводит их на тишине. Их можно смело удалять.
Что значит «Субтитры создавал…» в расшифровке?
Это подпись автора субтитров к какому-то видео из интернета. Программа, судя по всему, много раз встречала её при обучении и выдаёт на тишине. Такую строку можно удалить.
Как проверить, выдумывает ли моя программа текст?
Включите запись и помолчите полминуты, прикрыв микрофон ладонью. Если программа принимает файлы, дайте ей запись тишины. Программа, которая не выдумывает, вернёт пустоту. Если появились слова, точки или прощания — она дописывает на паузах.
Грозит ли это, если я просто диктую короткие сообщения?
Почти нет: в короткой диктовке пауз мало. Сильнее всего выдумки проявляются в длинных записях с молчанием — на созвонах и совещаниях.