# Расшифровка записи, которая не уходит в облако

Кадровое интервью, разговор с клиентом, приём врача - записи, которые нельзя грузить в облако. Разбираю, как расшифровать их на своём ноутбуке и чем платишь.

URL: https://posts.danashkin.ru/guides/rasshifrovka-zapisi-bez-oblaka
Обновлено: 2026-09-15

---

## Коротко

**Главное**

- Расшифровка записи не обязана уходить в облако. Модель распознавания речи работает прямо на ноутбуке, и файл никуда не отправляется.
- Это единственный рабочий вариант там, где запись содержит персональные данные, коммерческие условия или врачебную тайну: юристы, медицина, банки, кадровые интервью.
- Плата за приватность - время. На обычном ноутбуке час записи обрабатывается заметно дольше, чем в облачном сервисе, и это главное ограничение подхода.
- Качество регулируется выбором модели: маленькая быстрая для черновика, большая для итогового текста. Разница в скорости кратная.
- Пересказ и протокол тоже можно делать локально, но качество итогов у небольших локальных моделей ниже облачных, и это стоит знать заранее.

## Когда запись нельзя загружать в облачный сервис?

**Главное**

Когда в ней звучат данные, которые компания не имеет права передавать третьим лицам. Разговор с клиентом, кадровое интервью, врачебный приём, обсуждение условий сделки - материал, где вопрос не в удобстве, а в допустимости.

Тема всплывает на каждом корпоративном обучении и звучит одинаково: «нам служба безопасности не разрешит».

Разберём, где граница проходит на самом деле. Публичный вебинар, запись собственного выступления, разговор о планах на квартал без цифр - материал спокойный. А вот дальше начинается зона, где загрузка в облачный сервис требует отдельного решения:

| Тип записи | Что внутри | Почему облако проблема |
|---|---|---|
| Кадровое интервью | персональные данные кандидата | согласие на передачу третьим лицам обычно не получено |
| Разговор с клиентом | условия, скидки, претензии | коммерческая тайна и обязательства по договору |
| Врачебный приём | сведения о здоровье | отдельная категория данных с особыми требованиями |
| Внутреннее совещание | планы, цифры, персоналии | вопрос не юридический, а репутационный |

Ещё одно наблюдение из практики: чувствительность записи почти всегда выше, чем кажется говорящему. Человек помнит, что обсуждал условия сделки, и забывает, что в том же разговоре назвал фамилию сотрудника, сумму долга контрагента и причину, по которой ушёл клиент. Оценивать запись по теме встречи бесполезно, оценивать надо по тому, что в ней реально прозвучало.

Заметь: вопрос не в том, надёжен ли конкретный сервис. Вопрос в том, есть ли у тебя право передавать эту запись куда-либо вообще. Где вообще проходит граница чувствительных данных и как учить команду, когда документы нельзя грузить в чат, я разбирал в отдельном материале про [чувствительные данные и нейросети в компании](/guides/chuvstvitelnye-dannye-i-neyroseti-v-kompanii).

## Слово «локально» на практике

**Главное**

Модель распознавания скачивается один раз и дальше работает на твоём компьютере без интернета. Файл с записью не покидает диск, текст появляется рядом с ним. Внешний сервис в этой схеме не участвует вообще.

Расскажу на своём инструменте, потому что собирал его именно под эту задачу.

Выглядит он скучно: окно в браузере, куда перетаскиваешь файл, и кнопка. Дальше запись превращается в текст, и всё это время ноутбук работает сам с собой. Интернет нужен один раз - скачать модель распознавания, дальше можно выдернуть провод.

Три вещи, которые стоит понимать про такую схему:

1. **Модель живёт на диске**

   Файл модели весит от сотен мегабайт до нескольких гигабайт в зависимости от версии. Качается один раз, дальше лежит и используется.

2. **Считает процессор твоего компьютера**

   Никакой очереди и лимитов, но и никакого чужого мощного железа. Скорость упирается в твою машину.

3. **Сервис слушает только сам себя**

   Инструмент открывается по локальному адресу и наружу не смотрит. Это не сайт в интернете, а программа, которая нарисовала себе окно в браузере.

Собрать такую штуку под себя сегодня реально без разработчика: [вайбкодинг](/concepts/vibecoding) закрывает именно этот класс задач - маленький локальный инструмент под свой процесс. У меня на сборку ушло несколько вечеров, и большая часть времени ушла не на распознавание, а на приведение текста в читаемый вид.

## Сколько это стоит по железу и времени?

**Главное**

Денег - нисколько, инструменты бесплатные. Времени - существенно: на обычном ноутбуке без специального ускорения час записи обрабатывается дольше самой записи, и это надо закладывать в план.

Здесь начинается честная часть, которую в обзорах обычно пропускают.

Модели распознавания бывают разного размера, и разница между ними не косметическая. Маленькая работает быстро и путает термины. Большая узнаёт фамилии и специальные слова, но на длинной записи заставляет ждать.

На моём ноутбуке большая модель считает на процессоре, без ускорения видеокартой, и на записи в час это превращается в долгое ожидание. Практический вывод, к которому я пришёл: черновик делать быстрой моделью, а большую запускать только тогда, когда нужен точный текст для документа.

**Как не терять вечер**

Запусти длинную запись на большой модели перед перерывом или в конце дня. Инструмент не требует внимания: он либо досчитает, либо нет, но ждать у экрана точно не нужно.

Отдельно про то, чем это отличается от облачного сервиса. Облако вернёт текст за минуты и почти не ошибётся, потому что считает на мощном железе. Локальный вариант выигрывает не скоростью и не качеством, а тем, что запись остаётся у тебя. Выбор идёт именно по этому признаку, а не по удобству.

## Три ограничения, о которых не пишут

**Главное**

Записи по ссылке скачиваются не всегда, качество звука решает больше модели, а разделение говорящих локально работает хуже, чем в специализированных сервисах. Это не поводы отказаться, но знать их лучше заранее.

Собрал по собственным граблям, чтобы ты не потратил на них свои.

**Первое: ссылка не равна файлу.** Запись созвона, защищённая паролем, по ссылке чаще всего не скачивается. Лечится просто - скачать файл руками и положить в инструмент, но об этом узнаёшь в тот момент, когда торопишься.

**Второе: звук важнее модели.** Запись с включённого посреди стола телефона на восьмерых участников не спасёт никакая модель. Гарнитура одного говорящего даёт результат лучше, чем переход с маленькой модели на большую.

**Третье: кто именно говорит.** Разделение реплик по спикерам локально даётся хуже всего. Для интервью один на один это неважно, для совещания на шестерых - критично, и тут придётся либо размечать руками, либо мириться со сплошным текстом.

Ещё одна деталь, которая всплывает у всех: сырая расшифровка нечитаема. Там повторы, слова-паразиты, оборванные фразы. Приводить её в порядок - отдельная работа, которую как раз стоит отдать нейросети.

Отдельно стоит сказать про объём хранения. Расшифровки накапливаются быстро, и через полгода на диске лежит папка с текстами всех разговоров подряд. Приватность инструмента этой проблемы не решает: украденный или потерянный ноутбук отдаёт всю папку сразу. Шифрование диска и разбор старых записей раз в квартал - скучная, но обязательная часть схемы.

## Как выбрать между качеством и скоростью?

**Главное**

По назначению текста. Для поиска по смыслу и напоминания «о чём говорили» хватает быстрой модели с ошибками. Для цитат, протокола и документов нужен точный текст, и тогда время ожидания становится приемлемой ценой.

Правило, которое я применяю не задумываясь.

- **Черновик для себя** - быстрая модель. Ошибки в терминах не мешают вспомнить содержание разговора.
- **Задачи и решения по итогам встречи** - быстрая модель плюс обработка нейросетью. Смысл она восстановит и по неточному тексту.
- **Цитаты и протокол** - большая модель. Всё, что кто-то будет читать как «сказано дословно», требует точности.
- **Документ с юридической силой** - большая модель плюс вычитка человеком. Никакая расшифровка не отменяет проверку глазами.

Отдельный сценарий - регулярная обработка. Если записи приходят каждый день, инструмент стоит отвязать от твоего ноутбука и повесить на отдельную машину, чтобы он молол их сам. Как выглядит такой переезд, разбирал в материале про то, [как отвязать своего бота от включённого ноутбука](/guides/otvyazat-bota-ot-vklyuchennogo-noutbuka).

## Что делать с текстом дальше

**Главное**

Расшифровка сама по себе бесполезна: её никто не читает. Ценность появляется, когда из текста собраны задачи, решения и открытые вопросы, а исходник остаётся только как источник цитат.

Ошибка, которую совершают почти все на старте: получить текст и обрадоваться.

Текст встречи на час - это двадцать страниц, и через неделю их не откроет никто. Работает другое: из расшифровки собирается короткий результат, а сама она лежит рядом на случай спора.

Что стоит доставать из текста в первую очередь:

- Договорённости с ответственными и сроками.
- Решения, которые приняты, и решения, которые отложены.
- Вопросы, оставшиеся без ответа.
- Прямые цитаты по спорным местам, с указанием времени.

Пересказ можно делать тоже локально: небольшая модель на своей машине справляется с протоколом и тезисами. Качество итогов у неё ниже, чем у облачных сервисов, но для внутреннего документа обычно достаточно, а запись при этом никуда не уходит.

Полный разбор того, что вытаскивать из записи встречи и как сверять это с собственным планом, есть в отдельном материале про то, [как запись встречи превращается в задачи](/guides/zapis-vstrechi-prevrashchaetsya-v-zadachi). А про диктовку как способ ставить задачи голосом - в материале про то, что [голосом быстрее, чем руками](/guides/golosom-bystree-chem-rukami).

## Частые вопросы

**Главное**

Что спрашивают чаще всего: нужен ли мощный компьютер, работает ли это на Windows, как быть с записями на нескольких языках и обязательно ли предупреждать участников встречи.

### Частые вопросы

**Нужен ли мощный компьютер?**

Нет, но от него зависит терпение. На современном ноутбуке всё работает; разница со слабой машиной измеряется временем ожидания, а не возможностью запустить.

**Это работает на Windows?**

Да, инструменты кроссплатформенные. Разница только в способе установки, дальше поведение одинаковое.

**А если в записи два языка?**

Модели справляются с переключением, но точность падает на стыках. Если язык известен заранее, лучше указать его явно.

**Нужно ли предупреждать участников о записи?**

Да, и это вопрос не технический. Согласие на запись и на её обработку - обязательная часть, независимо от того, где именно считается текст.

## Главный вывод

**Главное**

Локальная расшифровка решает ровно одну задачу: запись остаётся у тебя. За это приходится платить временем и мириться с тем, что говорящих придётся различать самому. Там, где данные чувствительные, обмен выгодный.

Запомнить стоит одно: выбор между локальным и облачным вариантом делается не по удобству, а по допустимости. Если запись нельзя передавать наружу, вопрос закрыт, и остаётся вопрос настройки.

Практический минимум на сегодня: возьми одну старую запись, прогони её маленькой моделью и посмотри на результат. Этого хватит, чтобы понять, годится подход под твои задачи или нет.

А сколько записей с чувствительными разговорами у тебя уже лежит в облачном сервисе?

### Источники

- [Whisper - модель распознавания речи, Википедия](https://en.wikipedia.org/wiki/Whisper_%28speech_recognition_system%29)
- [faster-whisper - быстрая реализация распознавания на своём компьютере, GitHub](https://github.com/SYSTRAN/faster-whisper)
- [Ollama - запуск языковых моделей локально](https://ollama.com/)
- [Speech recognition - как устроено распознавание речи, Википедия](https://en.wikipedia.org/wiki/Speech_recognition)
