Расшифровка аудио в текст: пошаговая инструкция
Час ночи. Завтра к десяти нужна текстовая версия сегодняшней лекции, а пересматривать два часа записи нет сил и времени. Транскрипция аудио в текст (она же расшифровка) в Anoother делается без прослушивания целиком: файл или ссылка на видео загружаются в сервис, через 2–3 минуты обработки готовы полный текст и конспект с тезисами.
Похожая ситуация была у Насти, третьекурсницы медицинского факультета: две пары подряд, диктофон в телефоне записал 118 минут, а утром — коллоквиум. Дальше — её путь от файла на телефоне до текста в трёх шагах, с реальными цифрами по времени и деньгам.
Что понадобится: файл, ссылка и 15 бесплатных минут
Прежде чем начинать, стоит собрать четыре вещи — не три, потому что реальный список именно такой:
- Сама запись — аудио- или видеофайл с устройства, либо ссылка на ролик YouTube, VK Видео или RuTube.
- Браузер — расшифровка идёт через сайт, ничего устанавливать не нужно.
- Аккаунт — регистрация на пару минут через Яндекс или Google, без неё файл не загрузится (расшифровка «без регистрации» физически некуда сохраняется — файлы и конспекты привязываются к вашему профилю, карта при этом не нужна).
- 2–3 минуты ожидания — именно столько обычно занимает обработка часовой записи, дальше время растёт пропорционально длине.
Если это первая расшифровка — 15 минут дают бесплатно, без привязки карты. У Насти запись была почти в 8 раз длиннее, так что бесплатными оказались только первые 15 минут, а за остальное платить пришлось по обычному тарифу — детали цены чуть ниже.
Отдельно стоит понимать разницу между файлом и ссылкой: для аудио с диктофона или видео, снятого на телефон, нужен именно файл — сервис не подключается к камере или микрофону напрямую и не записывает разговор в реальном времени. Ссылка работает только для уже опубликованных роликов на YouTube, VK Видео или RuTube — то есть для контента, который уже существует в открытом доступе, а не для съёмки с нуля.
Шаг 1. Загрузите запись
Файл перетаскивается в окно загрузки — drag&drop, без меню и настроек. Поддерживаются форматы MP3, WAV и M4A, то есть подойдёт запись прямо с диктофона на iPhone или Android без конвертации. Если запись — не файл, а ролик на YouTube, VK Видео или RuTube, вместо файла вставляется ссылка на видео, и сервис сам вытащит из него звуковую дорожку — скачивать ролик на диск не нужно.
Часто на этом шаге возникает вопрос: а почему не через Google Docs — там же тоже есть бесплатное распознавание речи? Короткий ответ — Google Docs слушает только микрофон вживую и не принимает готовый файл, так что для записи, сделанной заранее, этот путь не подходит в принципе. Настя пробовала так делать с прошлой лекцией: включила запись на телефоне рядом с колонкой ноутбука и продиктовала обратно в Google Docs — качество упало настолько, что треть терминов пришлось переписывать вручную.
Настя загрузила файл с диктофона прямо с телефона, никуда не пересылая его на компьютер. Файл при загрузке шифруется — это касается любой записи, а не только учебной. Никакой предварительной обработки от пользователя не требуется: ни обрезки тишины в начале, ни конвертации формата, ни разделения на части, если запись длинная.
Шаг 2. Дождитесь обработки — что делает сервис эти 2–3 минуты
Пока крутится индикатор загрузки, внутри происходит не одно действие, а обработка в несколько заходов, и именно порядок здесь определяет итоговую точность. Сначала одна модель очищает звуковую дорожку от посторонних шумов — гула техники, эха аудитории, скрипа стульев. Затем вторая модель распознаёт уже очищенную речь, превращая звук в последовательность слов. После этого расставляется пунктуация, а сплошной поток слов делится на предложения и абзацы — опираясь на паузы и интонацию в самой записи. Мы прогоняли тестовые записи с фоновым кондиционером у себя внутри команды — разница между сырой и очищенной дорожкой слышна даже нетренированным ухом, без специальной подготовки. Время обработки зависит от длины записи: пятиминутная заметка обрабатывается почти мгновенно, а запись Насти на 118 минут потребовала около четырёх минут ожидания.
Шаг 3. Забирайте текст и конспект
На выходе — не один файл, а два результата сразу. Полный текст — дословная расшифровка со знаками препинания, разбитая на абзацы. Конспект — тезисы, темы и учебные карточки, собранные поверх текста автоматически, без отдельного запроса или доплаты. Всё это экспортируется в TXT, MD или PDF, в зависимости от того, куда текст пойдёт дальше — в заметки, в документ или в презентацию. Формат можно менять в любой момент после расшифровки, не запуская обработку заново.
Отдельная деталь, которая обычно всплывает не сразу, а через день-два использования: у текста есть поиск. Чаще всего люди ищут в расшифровке не смысл целиком, а конкретную цифру, дату или имя — и поисковая строка по транскрипту решает это за секунды, вместо того чтобы листать текст глазами в поисках нужного абзаца. Насте это пригодилось на самом коллоквиуме: она вспомнила дозировку препарата, названную преподавателем мельком где-то в середине пары, за десять секунд поиска по слову «доза» — против пятнадцати минут пролистывания тетради с конспектом от руки.
Сколько это стоит на практике
Цена считается по длительности записи: 7 ₽ за минуту звучания, независимо от того, аудио это или видео по ссылке. 30-минутная запись обойдётся в 210 ₽, часовая — в 420 ₽. Первые 15 минут любой записи бесплатны — этого достаточно, чтобы пройти шаги 1–3 целиком и увидеть результат до того, как платить за что-либо.
Запись Насти длилась 118 минут. Из них первые 15 — бесплатно, а оставшиеся 103 минуты обошлись в 721 ₽. Дешевле, чем стоил бы вечер репетитора перед коллоквиумом — и куда быстрее: репетитор нужен на вечер, а текст с конспектом был готов за четыре минуты.
Для разовой лекции это разовый расход. Для тех, кто расшифровывает записи регулярно — раз в неделю или чаще, — разумнее сразу прикинуть месячную сумму, а не считать каждую запись по отдельности: так виднее, окупается расход временем, которое иначе ушло бы на переслушивание вручную.
Если что-то пошло не так
Не всё идёт гладко с первого раза, и честнее сразу перечислить, что именно может потребовать ручной проверки — таких случаев на практике четыре.
- Экстремальный шум — стройка за окном, громкая музыка на фоне: точность падает, спорные фрагменты стоит сверить с оригиналом записи.
- Пересекающиеся реплики — когда два человека говорят одновременно, распознавание восстанавливает смысл по вероятности и иногда путает, кто что сказал.
- Слишком короткая запись — голосовая заметка на 3–4 секунды не даёт модели достаточно контекста, и часть слов может распознаться неточно.
- Повреждённый файл — если запись оборвалась на середине сохранения, часть аудио может быть нечитаемой, и это стоит проверить до загрузки.
Если ничего из этого не про вашу запись — результат обычно не требует правок вообще. У Насти, для сравнения, единственной проблемной точкой оказался момент, где преподаватель отвечал на вопрос из зала одновременно с шумом за окном стройки, — три предложения в середине текста пришлось перепроверить по записи вручную, всё остальное распозналось без замечаний.
Частые вопросы
Сколько ждать расшифровку часовой записи? Около 2–3 минут — обработка идёт быстрее, чем длится сама запись, потому что очистка звука, распознавание и расстановка пунктуации происходят на серверах параллельно с загрузкой.
Можно ли загрузить несколько файлов подряд? Да, ограничения на количество файлов нет — можно загружать записи одну за другой, каждая обрабатывается и оплачивается отдельно по своей длительности.
Подойдёт ли запись с диктофона iPhone? Да, стандартный формат диктофона iPhone — M4A — поддерживается без конвертации, так же как MP3 и WAV с любых других устройств.
Если вы ещё выбираете, каким способом лучше расшифровать запись — от голосового ввода до нейросетей, — есть обзор 7 способов перевести аудио в текст, где Anoother — только один из вариантов среди прочих.
Саму расшифровку аудио в текст можно проверить на своей записи прямо сейчас — без установки и без карты для первых 15 минут.