Я Лера, веду продвижение клиентов в студии «Контур». Половина моих задач — превращать «сырой голос» в готовый контент: расшифровывать интервью с экспертами, подкасты клиентов, записи созвонов. И я признаюсь: расшифровка была самой скучной и самой длинной частью моей недели.

Час разговора — это часа три ручной работы. Слушаешь, отматываешь, печатаешь, опять отматываешь. Потом вычищаешь «кхм», «э-э», «ну это самое» и бесконечные «давайте ещё раз». Если в записи двое — разбираешь, кто где говорит. К вечеру глаз дёргается, а готового текста всё нет.
Недавно Google выпустил Gemini 3.5 Transcribe — модель распознавания речи, которая закрывает всё это сама. Расскажу, как я встроила её в наш контент-пайплайн и что из этого вышло.
Шаг 1. Отправила запись — модель всё поняла сама
У клиента был подкаст: двое ведущих, час сорок, местами перебивают друг друга. Я отправила аудио в Gemini API (модель gemini-3.5-transcribe, она же доступна через Google AI Studio). Модель сама определила язык, сама разбила запись на реплики с таймкодами. Настраивать ничего не пришлось — просто отдала файл и получила текст.
Шаг 2. Мусор убрала модель, а не я
Самое приятное — модель сама выкинула «кхм», «э-э» и оговорки. И расправила самоисправления: когда спикер говорит «встретимся во вторник… нет, в среду», в тексте остаётся только «в среду». Раньше на такую чистку у меня уходил отдельный вечер — теперь она бесплатная.
Шаг 3. Чистый текст — в работу
Дальше — магия контент-пайплайна. Чистую расшифровку с таймкодами я отдаю языковой модели и прошу собрать из неё статью в блог, тезисы для постов и цитаты на карточки. Полчаса — и контент на неделю готов. Раньше между записью подкаста и публикацией проходило два дня, теперь всё укладывается в один вечер.
Шаг 4. Где подстелить соломку
Честно про ограничения. Точно атрибутировать реплики модель умеет до трёх спикеров, дальше — уже экспериментально: когда в записи было четверо гостей, я нарезала её на части и сверяла вручную. Ещё модель поддерживает свой словарь — если в подкасте много терминов и имён, задай их заранее и сэкономишь время на правке.
Урок
Расшифровка — то самое узкое место, о котором все забывают, пока оно не съедает половину недели. Gemini 3.5 Transcribe закрыла его за вечер: по замерам Google, около 2,6% ошибок на предзаписанном аудио, 85+ языков с автоопределением, разделение спикеров. Теперь мой пайплайн выглядит так: записал → расшифровал → собрал контент. Без ручной транскрибации.
Голос — это черновик, который раньше переписывали руками. Теперь черновик приходит уже чистовым — остаётся решить, что из него вырастет. Архон.