
В понедельник я поставил себе условие: три дня не набирать рабочий текст руками. Только голос. Хотелось понять, где диктовка экономит время руководителя, а где расплачиваешься правками смет и ТЗ. Инструмент — Voicetypr; канал «Start ИИ» подал его как «всё бесплатно».
Поправка из README. Бесплатно — только триал: три дня, без карты. Дальше локальные модели работают без лимитов по lifetime-лицензии: Pro — 39 долларов, Plus — 69, Max — 99, с возвратом денег в течение недели. Репозиторий переехал: актуальный адрес ideaplexa/voicetypr, ссылка из поста редиректит туда же. Лицензия AGPL-3.0, язык Rust, 720 звёзд, последний коммит — сегодня.
День первый: письма и заметки
Ставлю курсор в поле, жму горячую клавишу, говорю — текст появляется там, где стоял курсор, а не в отдельном окне. Распознавание идёт на ноутбуке: Whisper на обеих системах, на Apple Silicon вдобавок модели Parakeet. Аудио никуда не уходит: переговоры с клиентом не лежат в чужом облаке. Языков заявлено 99 с автоопределением.
Письма и заметки получились с первого раза, почти без правок. Речь сама разбивается на абзацы, а «э-э» и повторы подчищает необязательный шаг форматирования через OpenAI, Anthropic или Gemini — по счётчику токенов провайдера.
День второй: где стало больно
ТЗ на интеграцию — провал. Имена переменных, строки кода, названия эндпоинтов диктовка превращает в кашу: голосом не продиктуешь, где дефис, а где нижнее подчёркивание. Термины вроде «идемпотентность» модель распознала, а фамилию подрядчика пришлось переписывать трижды. Точки с запятой, кавычки-ёлочки и отступы — по-прежнему работа клавиатуры.
Вывод дня простой: голос годится для текста, который читают люди, и плохо годится для текста, который читает компилятор. Зато планёрку я больше не конспектировал: прогнал запись через транскрипцию файла, получил расшифровку с разделением по говорящим и дальше искал нужное место поиском по истории.
День третий: то, ради чего это мне нужно
У приложения есть CLI: ставится из настроек, отдаёт текст или JSON. Это значит, что задачи можно наговаривать не человеку, а своему агенту — у него появляются уши. Я говорю постановку, скрипт передаёт расшифровку тому, кто ведёт проект, и в работу уходит формулировка, сказанная на ходу, а не забытая по дороге к столу. Отдельная функция — сеть: одна машина с мощной видеокартой может работать транскрибатором для лёгкого ноутбука по локальной сети.
Установка заняла десять минут: скачал сборку для macOS 14 и выше, выдал доступ к микрофону и, для вставки текста, к универсальному доступу, выбрал модель. На Windows нужен билд 19041 или одиннадцатая версия — есть вариант из Microsoft Store. Дальше меняется только привычка: вместо открытия документа я жму клавишу.
Итог трёх дней: письма, заметки, постановки задач и разбор записей голосом — да. Договоры, ТЗ и код — нет, там дешевле печатать. Считаю так: если за день диктовка возвращает хотя бы полчаса, лицензия за 69 долларов отбивается за три недели — это уже не эксперимент, а привычка команды.