DF-ИИ-001 · ИИ в работе команды
Расшифровка встреч и звонков: как получить готовый протокол
- Как записать встречу или звонок и соблюсти закон о персональных данных
- Чем облачный сервис с серверами в России отличается от локального распознавания
- Как из расшифровки собрать протокол: решения, задачи, ответственные
- Где автоматика ошибается и что проверять человеку
После встречи или звонка запись обычно отправляется в папку «разобрать позже» — и остаётся там: переслушивать час обсуждения некому, а договорённости забываются за пару дней. Сама по себе она решений не фиксирует.
Расшифровка встреч и звонков укладывается в три шага: записать с уведомлением участников, превратить запись в текст — облачным сервисом с серверами в России или локально — и собрать из текста протокол: решения, задачи, ответственные. Готовую сводку проверяет человек: автоматика путает имена и числа. Ниже — что требует закон, чем отличаются сервисы и как выглядит протокол, который не приходится переделывать.
Зачем протокол, если есть запись?
Запись хранит всё, поэтому ничего не даёт: чтобы найти одно решение, придётся переслушать обсуждение целиком. Протокол работает иначе. У него точное определение: «Протокол (заседания). Информационно-справочный документ, фиксирующий ход заседания (совещания) и принятые решения» — формулировка из инструкции по делопроизводству, термин из словаря ВНИИДАД (КонсультантПлюс).
Споры рождаются из разницы между «мы обсуждали» и «мы решили». Обсуждение — варианты и сомнения, решение — конкретное «делаем так» с ответственным и сроком. Протокол оставляет только второе: задачи видны сразу, а спор о том, о чём договорились, закрывается одной ссылкой на документ.
Как записать встречу и не нарушить закон?
Голос человека — персональные данные: запись встречи или звонка попадает под 152-ФЗ. Для неё нужно законное основание (ст. 6); с внешними участниками это, как правило, их согласие — «конкретное, предметное, информированное, сознательное и однозначное», оформленное отдельно от других документов (ч. 1 ст. 9 152-ФЗ). Уведомление в приглашении и объявление в начале записи — необходимый минимум, но согласием они не являются.
Передача записи сервису расшифровки — поручение обработки (ч. 3 ст. 6, с согласия субъекта): оператором остаётесь вы, а у обработчика в договоре фиксируются состав данных, действия, цели, конфиденциальность и требования к защите. Отдельно проверьте, где сервис хранит данные: накопление персональных данных россиян в базах за пределами России не допускается (ч. 5 ст. 18).
Как оформить поручение подрядчику, разобрано в статье о техническом задании. Для записей с работниками, клиентами и третьими лицами порядок согласий подскажет юрист: статья не заменяет правовую оценку.
Как запись превращается в текст?
Расшифровка (транскрибация) — превращение аудио в текст. Облачный сервис принимает файл, распознаёт речь и отдаёт документ с разбивкой по говорящим — это диаризация: видно, кто именно обещал прислать смету. Асинхронное распознавание SpeechKit Яндекса рассчитано на предзаписанные длинные файлы — до четырёх часов: в документации режим называется «транскрибация аудиозвонков и выступлений» (документация SpeechKit).
В Yandex AI Studio есть готовое решение «Протоколирование и суммаризация онлайн-встреч с ИИ»: оно расшифровывает запись и собирает сводку — «решения, ключевые тезисы, следующие шаги по встрече и по темам» (страница решения); в описании заявлено хранение данных на серверах в России. Русскую и английскую речь, в том числе длинные записи, распознаёт и SaluteSpeech Сбера (страница «Транскрибация»).
Для чувствительных записей — кадровые вопросы, переговоры, данные клиентов — есть локальное распознавание: модель работает на вашем сервере, и файл не покидает ваш контур. Так применяют свободную модель Whisper с лицензией MIT: её ставят на ваш сервер (репозиторий проекта). Контур расшифровки выбирают по чувствительности данных — подход к чувствительным записям кратко описан в карточке услуги.
| Признак | Облачный сервис | Локальное распознавание |
|---|---|---|
| Где обрабатывается запись | на серверах провайдера | на вашей машине |
| Что нужно для старта | аккаунт и файл записи | сервер и настройка модели |
| Кому подходит | планёрки, звонки, интервью | чувствительные переговоры |
| Узкое место | зависимость от провайдера | нужен специалист |
Как из текста собрать протокол?
Минимальный шаблон работает и для планёрки, и для звонка с клиентом:
Протокол встречи
Дата и участники
Решения: что решили по каждому вопросу
Задачи: что сделать — кто — к какому сроку
Открытые вопросы: что отложили и почему
Сводку по шаблону собирает и языковая модель: Yandex AI Studio формирует тезисы и следующие шаги автоматически. Но финальную редактуру делает человек. Модель видит только текст записи: ей неизвестно, что «Ольга» — ваш бухгалтер, а задача «на неделе» без даты никого не двигает.
Настройку начинают с пилота на одном типе встреч: берут две-три реальных записи, прогоняют через выбранный контур и правят шаблон протокола, пока изменения дёшевы. На выдуманных примерах протокол настраивается неверно, поэтому для пилота нужны настоящие записи — с уведомлением участников, а если расшифровку делает подрядчик, то по договору поручения.
Форму протокола и критерии приёмки — например, «задачи содержат ответственного и срок» — фиксируют до старта; полный путь описан в гайде по порядку работы.
Где автоматика ошибается?
Цифры точности из рекламы выглядят убедительно, но боевые записи грязнее тестовых. Типовые слабые места известны по замерам на русской речи: имена и бренды (деревня «Серёдка» превращается в «селёдку»), термины и новая лексика, фоновый шум и голоса, говорящие одновременно (замеры на телефонии).
Хуже простой ошибки — выдумка. «На тишине или музыке Whisper способен генерировать правдоподобный, но отсутствующий в записи текст», — отмечает обзор моделей распознавания для русского языка (speech2text.ru). Сводки грешат тем же: исследование сводок встреч на языковых моделях COLING 2025 нашло пропуски важного и добавление лишнего — ещё одна причина отдавать финальную редактуру человеку.
Документация SaluteSpeech рекомендует то же: «лучше подключить к работе по транскрибации текста человека для постобработки готового материала» (страница «Транскрибация»).
Поэтому готовый протокол проверяйте: имена, суммы и даты сверяйте с записью по таймкодам, каждую задачу — с исполнителем. Сомнительные фрагменты уходят человеку на разбор: одно неверное число дешевле поймать до письма клиенту, чем после.
Вопросы и ответы
Можно ли расшифровать запись без согласия участников?
Только при другом законном основании и если участников предупредили о записи: голос — персональные данные. Сервису расшифровки запись передают по договору поручения, как правило с согласия участников (ч. 3 ст. 6 152-ФЗ). Записывать чужие звонки, в которых вы не участвуете, нельзя: это нарушение тайны телефонных переговоров и иных сообщений (ч. 2 ст. 23 Конституции РФ, ст. 138 УК РФ).
Чем локальное распознавание отличается от облачного?
Тем, где обрабатывается запись. Облачный сервис принимает файл на своих серверах — для персональных данных россиян они должны находиться в России. Локальная модель работает на вашей машине, запись никуда не уходит — это вариант для чувствительных переговоров.
Нужен ли программист, чтобы это заработало?
Разовый файл расшифрует и человек без подготовки: у сервисов есть интерфейс загрузки. Запись с чужими голосами загружайте, только убедившись, что условия сервиса включают поручение на обработку данных и хранение в России. Связка «запись — текст — протокол — задачи» собирается через API — программный интерфейс сервиса; это типовая работа для разработчика или студии автоматизации, включая выбор контура под чувствительность данных.
Источники
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных» — КонсультантПлюс
- Инструкция по делопроизводству: термин «протокол» из словаря ВНИИДАД (2014) — КонсультантПлюс
- Распознавание речи (SpeechKit) — документация Yandex AI Studio
- Протоколирование и суммаризация онлайн-встреч с ИИ — Yandex AI Studio
- Транскрибация аудио в текст — SaluteSpeech, документация Сбера
- Whisper — распознавание речи с лицензией MIT, репозиторий OpenAI
- Замеры распознавания русской речи в телефонии — Хабр
- Обзор моделей распознавания речи для русского языка — speech2text.ru
- Kirstein, Ruas, Gipp. Ошибки сводок встреч языковых моделей (COLING 2025) — arXiv