Я Лера, веду продвижение клиентов в студии «Контур». Половина моих задач — превращать «сырой голос» в готовый контент: расшифровывать интервью с экспертами, подкасты клиентов, записи созвонов. И я признаюсь: расшифровка была самой скучной и самой длинной частью моей недели.

Gemini 3.5 Transcribe — распознавание речи

Час разговора — это часа три ручной работы. Слушаешь, отматываешь, печатаешь, опять отматываешь. Потом вычищаешь «кхм», «э-э», «ну это самое» и бесконечные «давайте ещё раз». Если в записи двое — разбираешь, кто где говорит. К вечеру глаз дёргается, а готового текста всё нет.

Недавно Google выпустил Gemini 3.5 Transcribe — модель распознавания речи, которая закрывает всё это сама. Расскажу, как я встроила её в наш контент-пайплайн и что из этого вышло.

Шаг 1. Отправила запись — модель всё поняла сама

У клиента был подкаст: двое ведущих, час сорок, местами перебивают друг друга. Я отправила аудио в Gemini API (модель gemini-3.5-transcribe, она же доступна через Google AI Studio). Модель сама определила язык, сама разбила запись на реплики с таймкодами. Настраивать ничего не пришлось — просто отдала файл и получила текст.

Шаг 2. Мусор убрала модель, а не я

Самое приятное — модель сама выкинула «кхм», «э-э» и оговорки. И расправила самоисправления: когда спикер говорит «встретимся во вторник… нет, в среду», в тексте остаётся только «в среду». Раньше на такую чистку у меня уходил отдельный вечер — теперь она бесплатная.

Шаг 3. Чистый текст — в работу

Дальше — магия контент-пайплайна. Чистую расшифровку с таймкодами я отдаю языковой модели и прошу собрать из неё статью в блог, тезисы для постов и цитаты на карточки. Полчаса — и контент на неделю готов. Раньше между записью подкаста и публикацией проходило два дня, теперь всё укладывается в один вечер.

Шаг 4. Где подстелить соломку

Честно про ограничения. Точно атрибутировать реплики модель умеет до трёх спикеров, дальше — уже экспериментально: когда в записи было четверо гостей, я нарезала её на части и сверяла вручную. Ещё модель поддерживает свой словарь — если в подкасте много терминов и имён, задай их заранее и сэкономишь время на правке.

Урок

Расшифровка — то самое узкое место, о котором все забывают, пока оно не съедает половину недели. Gemini 3.5 Transcribe закрыла его за вечер: по замерам Google, около 2,6% ошибок на предзаписанном аудио, 85+ языков с автоопределением, разделение спикеров. Теперь мой пайплайн выглядит так: записал → расшифровал → собрал контент. Без ручной транскрибации.

Голос — это черновик, который раньше переписывали руками. Теперь черновик приходит уже чистовым — остаётся решить, что из него вырастет. Архон.

#apet #контент #AI #тексты