Почему диктовка путает слова и как это исправить

Голосовой ввод ошибается по нескольким понятным причинам, и многие из них можно устранить самому, без настроек и без новой программы. Есть и одна неочевидная: иногда программа пишет то, чего вы не говорили.

КороткоКачество диктовки зависит от звука (микрофон, расстояние, шум, эхо), от речи (темп, чёткость, паузы) и от самих слов (редкие слова, имена, короткие фразы без контекста). Не стоит «улучшать» звук перед распознаванием: в нашем замере июля 2026 это ухудшило результат. А ошибку, которая повторяется, надёжнее всего чинит словарь.

Продиктовали «договор подписан», а в тексте «договор подписал». Или имя коллеги превратилось в обычное слово. Прежде чем решать, что программа плохая, стоит выяснить, на каком этапе возникла ошибка: у ошибки обычно есть понятная причина, и часть причин убирается за минуту.

Как распознаватель выбирает слово

Он слушает звук и подбирает слово, которое подходит и по звучанию, и по соседям. Поэтому ошибки делятся на две группы: звук разобрать трудно или контекста не хватает, чтобы выбрать из похожих слов. Эти же группы подсказывают, что делать.

Микрофон и расстояние

Чем дальше микрофон от рта, тем больше в записи комнаты и меньше вашего голоса. Для распознавания это неудобно. В нашем замере 13 сентября 2026 на речи, записанной дальним микрофоном (набор Golos), доля ошибочных слов у модели Parakeet была 9,8 %, а на чтении (набор FLEURS) — 6,2 %. Наборы записей разные, так что строгим сравнением это считать нельзя, и с чужими программами сравнивать тоже; но дальний микрофон в этом замере оказался на более трудной стороне.

  • Если у вас есть выбор, диктуйте в микрофон, который ближе ко рту.
  • Проверьте, какой микрофон выбран в системе: подключённый монитор или гарнитура иногда незаметно становятся микрофоном по умолчанию.
  • Не закрывайте микрофон рукой и не диктуйте, отвернувшись.

Шум и эхо

Фоновый разговор, вентилятор, клавиатура рядом с микрофоном мешают распознаванию, потому что распознаватель слышит их наравне с вами. Эхо — отдельная неприятность: если звук играет из колонок, микрофон записывает и его. Чужая речь из динамиков попадёт в текст так, будто вы её сказали.

  • Диктуйте, пока рядом ничего не говорит и не играет.
  • Если слушаете что-то в колонках, поставьте паузу на время диктовки.
  • Закройте окно или дверь, если шум за ними.

Темп и чёткость

Быстрая речь с «проглоченными» окончаниями — причина ошибок: «подписал» и «подписан» различаются одной буквой, которую легко не договорить. Не нужно говорить как диктор. Достаточно договаривать окончания и не сливать слова в одно.

Простой приём: думайте фразой, потом говорите её целиком. Распознавателю проще, когда речь идёт ровно, а не рывками с поправками на ходу.

Короткие фразы без контекста

Фразу из одного-двух слов распознать труднее: подсказать, какое из похожих слов подходит, нечему. «Банк» и «бант», «вес» и «весь» звучат почти одинаково, и в длинном предложении их различает смысл. Поэтому одиночные слова и обрывки — самое слабое место любой диктовки.

Если нужно именно короткое слово, добавьте к нему слово-подсказку, а потом удалите. Или просто напечатайте его: для двух-трёх слов клавиатура быстрее.

Редкие слова и имена

Фамилия, название фирмы, профессиональный термин, малоупотребительное слово — всё, что распознаватель встречал редко, — он заменит похожим и частым. Ошибка выглядит как «странное слово там, где должно быть имя». С таким лучше не бороться произношением, а исправить один раз и закрепить: об этом ниже, в разделе про словарь. Отдельно об английских названиях в русской речи — в статье «Английские слова в русской диктовке».

Паузы

Пауза посреди фразы сама по себе не мешает распознаванию слов, но влияет на знаки препинания: распознаватель может принять паузу за конец предложения и ставит точку, хотя вы просто подбирали слово. Что с этим делать и как это устроено — в статье про знаки препинания. Для слов важнее другое: длинная пауза посреди слова или имени, которое вы вспоминаете, может «разрезать» его надвое.

Не «улучшайте» звук

Кажется логичным: подтянуть громкость, вырезать тишину между словами — распознавателю же легче. Мы проверили, и вышло наоборот. В нашем замере июля 2026 «улучшение» звука ухудшило распознавание:

Что сделали со звукомДоля ошибочных слов выросла на
Автоматическая регулировка громкости6,1 процентного пункта
Вырезание тишины7,9 процентного пункта
И то и другое вместе8,8 процентного пункта

Это замер на наших записях и наших моделях, а не закон природы. Но практический вывод простой: если у программы есть настройки «подавление шума», «автоуровень» или «вырезать паузы», не считайте, что включённая опция даст лучший результат. Проверьте на своём голосе: надиктуйте один и тот же абзац с опцией и без.

Когда программа пишет то, чего вы не говорили

Есть ошибка другого рода: в тишине или при фоновом шуме распознаватель вдруг выдаёт целые фразы, которых никто не произносил. Модели, обученные на огромном числе записей, способны «дорисовывать» текст из шума. Это не ваша ошибка и не сбой микрофона.

В нашем замере 13 сентября 2026 мы подали моделям по 30 секунд тишины и шума. Whisper turbo выдумал текст в 6 случаях из 6, Parakeet — в 0 случаев. Для русской речи на компьютере Doslovno использует модель Parakeet. Это результат нашего замера на наших записях, а не гарантия для любого шума.

Отдельно в Doslovno есть защита на случай, если текст на тишине всё же появится: приложение не вставляет результат, в котором нет ни одной буквы, например одиночную точку или «100%». Вставить в чужое письмо точку, которую вы не диктовали, было бы хуже, чем не вставить ничего.

Как понять, где именно ошибка

Чтобы не гадать, меняйте по одному условию. Надиктуйте один и тот же абзац дважды: сначала как обычно, потом ближе к микрофону и в тишине. Если второй раз заметно лучше, дело в звуке. Если ошибки остались те же и в тех же местах, дело в самих словах: это редкие слова, имена или названия, и справиться с ними поможет словарь, а не новый микрофон.

Так же полезно посмотреть, где ошибки стоят. В начале фразы, когда вы только вдохнули и заговорили, или в конце, когда темп падает, — это про речь. Посреди длинного предложения на одном и том же слове — про слово.

Что делать, когда ошибка уже есть

  1. Выясните, разовая она или повторяется. Разовую поправьте руками и забудьте.
  2. Если слово путается постоянно, заведите его в словаре. Словарь — список «как распознано» → «как должно быть». Он не угадывает, а подменяет, поэтому работает одинаково на коротких и длинных фразах.
  3. Проверьте звук. Расстояние до микрофона, шум и эхо — три причины, которые вы устраняете за минуту.

В Doslovno словарь устроен просто: поправили слово один раз — дальше приложение пишет его правильно само. Если вы пользуетесь другой программой, поищите в ней словарь или список замен: принцип тот же.

Коротко

Ближе к микрофону, тише вокруг, чётче окончания, звук не «улучшать», повторяющиеся ошибки — в словарь.

Вопросы

Почему диктовка пишет не то слово?

Распознаватель выбирает слово по звуку и по соседним словам. Ошибка появляется, когда звук плохой (далёкий микрофон, шум, эхо), когда речь слишком быстрая или смазанная, когда слово редкое или это имя, и когда фраза слишком короткая, чтобы подсказать контекст.

Стоит ли обрабатывать звук перед распознаванием?

Не обязательно и, возможно, вредно. В нашем замере июля 2026 автоматическая регулировка громкости ухудшила долю ошибок на 6,1 процентного пункта, вырезание тишины — на 7,9, вместе — на 8,8. Это замер на наших записях, а не закон для всех программ.

Почему программа вставила текст, хотя я молчал?

Некоторые модели распознавания способны выдумывать текст на тишине и шуме. В нашем замере 13 сентября 2026 Whisper turbo выдумал текст в 6 случаях из 6, Parakeet — в 0. Doslovno не вставляет результат, в котором нет ни одной буквы, например одиночную точку или «100%».

Как исправить слово, которое диктовка пишет неправильно всегда?

Завести его в словаре: поправили один раз — дальше программа пишет его правильно сама. В Doslovno это работает именно так.