Распознавание речи на компьютере или в облаке: в чём разница

Любая программа голосового ввода превращает звук в текст либо на вашем компьютере, либо на чужом сервере. Ниже — что от этого меняется, где каждый подход лучше и где мы сами не знаем ответа.

КороткоРаспознавание на компьютере не отправляет звук никуда, работает без сети после скачивания модели и занимает место на диске (у нас — около 600 МБ), но знает ограниченный набор языков. Облако не требует скачивать модель и понимает другие языки, но звук уходит на чужой сервер. Какой подход точнее, зависит от конкретных моделей, а не от места, где они работают.

Когда вы говорите, программе нужно превратить звук в буквы. Сделать это можно двумя способами: запустить модель распознавания прямо на вашем компьютере или отправить звук на сервер, где её запускает кто-то другой. Оба способа рабочие, и у каждого свои цена и ограничения. Если вы выбираете программу для диктовки, полезно понимать, что именно вы выбираете.

Сравнение проверено 5 октября 2026. Где мы приводим числа, рядом стоят дата и пометка «наш замер». Где чисел нет, мы их не придумываем.

Коротко: сравнение по пунктам

Что сравниваемНа компьютереВ облаке
Кто слышит звуктолько ваш компьютерсервер, куда звук отправили
Без интернетаработает после скачивания моделине работает
Место на дискеу Doslovno около 600 МБмодель скачивать не нужно
Языкиу Doslovno сейчас русскийдругие языки
Английские названияу Doslovno кириллицей («зум»)у Doslovno обычно латиницей (Zoom)

Дальше — по порядку, с оговорками.

Приватность: кто слышит звук

При распознавании на компьютере звук не покидает ваш компьютер: сети для этого шага не нужно. При облачном распознавании запись отправляется на сервер, и дальше вы опираетесь на слово его владельца: что он не сохранит запись и не использует её для обучения. Проверить такое обещание снаружи нельзя, это относится к любому облаку.

Есть деталь, которую легко упустить: распознавание звука в текст — не единственный шаг. Некоторые программы после него отправляют уже готовый текст на расстановку знаков или правку. Поэтому вопрос «где распознаётся речь» нужно дополнять вопросом «уходит ли наружу текст».

У Doslovno это устроено так: на бесплатном тарифе речь распознаётся на компьютере, а текст (не звук) уходит на вычитку языковой моделью, которая ставит знаки по смыслу. Переключатель «Только на этом Маке» закрывает и это: наружу не уходит ничего. Подробный разбор по случаям — в статье «Куда уходит ваш голос, когда вы диктуете».

Работа без интернета

Облачное распознавание без сети не работает по определению: звуку некуда идти. Распознавание на компьютере работает, если модель уже лежит на диске. Цена у этого одна: модель сначала нужно скачать, и пока она не скачана, нужен интернет.

У Doslovno есть нюанс: пока модель скачивается, диктовка идёт через наш сервер, потому что другого способа распознать речь в этот момент нет. Если вы хотите работать совсем без сети, включайте «Только на этом Маке» после того, как модель скачалась. Если включить его раньше, модель неоткуда будет взять. Без сети знаки препинания тогда ставит только сам распознаватель, без отдельной вычитки.

Про встроенные средства Mac и Windows и про то, что из них работает офлайн, мы написали отдельно: «Голосовой ввод без интернета».

Качество: что показал наш замер и чего он не показывает

Здесь легко сделать неверный вывод, поэтому будем точны. Мы сравнили две конкретные модели на кусках речи по 30 секунд. Наш замер, 13 сентября 2026:

  • на чтении вслух (набор FLEURS) доля ошибочных слов: Parakeet — 6,2 %, Whisper turbo — 16,8 %;
  • на записи с дальнего микрофона (набор Golos): Parakeet — 9,8 %, Whisper turbo — 21,3 %;
  • на тишине и шуме Whisper turbo выдумал текст в 6 случаях из 6, Parakeet — в 0 случаях.

Parakeet — локальная модель Doslovno. Whisper turbo — другая модель, которую можно запускать и на компьютере, и в облаке.

Чего из этого замера не следует

Мы сравнили две модели, а не «локальное» с «облачным». Облачного распознавания, которое использует Doslovno на платных тарифах, в этом замере не было, поэтому мы не утверждаем, что оно хуже или лучше. Вывод «на компьютере всегда точнее» из наших чисел сделать нельзя. Точность определяет модель, а не то, где она запущена.

Языки

Здесь у распознавания на компьютере слабое место. Локальная модель Doslovno сейчас понимает русскую речь. Если вы диктуете на других языках, вам нужно облачное распознавание: оно входит в платные тарифы Doslovno. Если вы диктуете только по-русски, это ограничение вас не касается. Если смешиваете языки в одной фразе, проверьте на своей речи, как справляется нужный вам вариант.

Английские названия

Названия программ и сервисов в русской речи — отдельная тема. Локальная модель Doslovno пишет их кириллицей: «зум» вместо Zoom. В нашей проверке 25 сентября 2026 латиницей не вышло ни одного названия из 11. Это чинит словарь: поправили слово один раз, и дальше программа пишет его правильно сама.

Облачное распознавание на платных тарифах Doslovno обычно оставляет такие названия латиницей. На бесплатном тарифе рассчитывать на латиницу без словаря не стоит.

Место на диске

Модель распознавания Doslovno занимает около 600 МБ. Приложение скачивает её само после первого запуска. Облачному распознаванию такое место не нужно. Про память, нагрев и расход батареи мы цифр не приводим: мы их не измеряли.

Задержка

Наш замер, 18 сентября 2026, по журналу автора, 104 диктовки: медиана времени от отпущенной клавиши до появления текста в курсоре — 1,4 с, 90 % диктовок уложились в 2,8 с. Это замер всего пути, включая распознавание, расстановку знаков и вставку.

Из него нельзя сделать вывод, что локальное распознавание быстрее облачного или наоборот: мы такого сравнения не проводили. Если для вас важна скорость, замерьте задержку на своих диктовках и своём интернете: она зависит и от компьютера, и от соединения.

Где что у Doslovno

  • Бесплатный тариф. Распознавание на компьютере после скачивания модели, минуты речи не ограничены. Пока модель скачивается, распознавание идёт на нашем сервере.
  • Платные тарифы (от 390 ₽ в месяц, цены на сайте). Облачное распознавание, речь на других языках, модель скачивать не нужно.

Если честно, для распознавания облако Doslovno нужно в двух случаях: вы диктуете не по-русски или не хотите скачивать модель. Русскую речь бесплатный тариф распознаёт на компьютере.

Как выбирать

  1. Решите, что для вас важнее: чтобы звук не уходил с компьютера или чтобы заработало на любом языке.
  2. Спросите у любой программы: уходит ли звук, уходит ли текст, что хранится и где. Если ответа нет, считайте, что уходит.
  3. Проверьте на своей речи: на своём микрофоне, со своими названиями и терминами. Чужие проценты точности говорят о чужих записях.

Вопросы

Что приватнее: распознавание на компьютере или в облаке?

Распознавание на компьютере: звук остаётся у вас. В облаке звук уходит на сервер, и вы полагаетесь на обещание его владельца не хранить и не использовать запись. Но даже при распознавании на компьютере программа может отправлять наружу текст, например на расстановку знаков, поэтому спрашивайте о каждом этапе отдельно.

Работает ли локальное распознавание без интернета?

Да, когда модель уже скачана на компьютер. В Doslovno для полного отсутствия сетевых запросов включается переключатель «Только на этом Маке» (в Windows такой же). Включайте его после того, как модель скачалась.

Локальное распознавание точнее облачного?

Это зависит от моделей, а не от места запуска. В нашем замере 13 сентября 2026 локальная модель Parakeet ошибалась реже, чем Whisper turbo, но это сравнение двух конкретных моделей, и вывода «локально всегда лучше» из него сделать нельзя.

Сколько места занимает модель распознавания?

Модель Doslovno для русской речи занимает около 600 МБ. Приложение скачивает её само после первого запуска.

Можно ли диктовать на других языках в Doslovno?

Сейчас локальная модель понимает русскую речь. Речь на других языках распознаётся в облаке, оно входит в платные тарифы.