Расшифровка офлайн
Записывает и расшифровывает русскую и английскую речь, язык можно определять автоматически. Текст появляется прямо во время записи.
VoiceMind сам расшифровывает речь, делит разговор по голосам и выписывает из него задачи. Всё считается на телефоне — запись никуда не отправляется, интернет нужен только чтобы один раз скачать модели.
Не просто текст из аудио: VoiceMind помогает разобраться, кто что сказал и о чём договорились.
Записывает и расшифровывает русскую и английскую речь, язык можно определять автоматически. Текст появляется прямо во время записи.
Делит разговор по собеседникам. Можно указать, сколько было человек, и дать им имена.
Локальная нейросеть выписывает задачи, встречи и договорённости. Шаблоны итогов: встреча, приём, консультация, интервью, лекция.
Спросите, о чём договорились или что сказал конкретный человек, — ответ строится по тексту этой записи.
Расшифровывает готовые файлы: голосовые из Telegram и WhatsApp, записи диктофона, mp3, m4a, ogg, wav. В Telegram — «Поделиться» → «Расшифровать в VoiceMind».
Добавьте имена, названия и редкие термины — распознавание будет писать их правильно.
Подсвечивает места, где распознавание не уверено: нажали на слово — услышали этот фрагмент. Текст можно поправить.
Записи хранятся по дням, по ним работает поиск. Экспорт в Markdown, PDF и DOCX.
По желанию подключается к Яндекс Календарю и напоминает о встречах, найденных в записях.
Внутри — открытые нейросети, которые запускаются прямо на процессоре телефона, а если подходит видеокарта — на ней.
Нажмите большую кнопку или откройте готовое аудио. Паузы пропускаются, длинная запись распознаётся кусками прямо во время диктовки.
Whisper large-v3-turbo, дообученный на русском (whisper-podlodka-turbo), превращает речь в текст.
Модели pyannote и WeSpeaker делят разговор по голосам собеседников.
Локальная языковая модель Gemma-2-2B выписывает задачи, собирает итоги по шаблону и отвечает на вопросы по записи.
| Для чего | Модель | Размер |
|---|---|---|
| Распознавание, режим «Точно» | whisper-podlodka-turbo (Whisper large-v3-turbo), q4_0 | 474 МБ |
| Распознавание, режим «Быстро» | whisper-small q5_1 | 190 МБ |
| Поиск речи в записи | Silero VAD | 0,9 МБ |
| Разделение по голосам | pyannote segmentation-3.0 + WeSpeaker ResNet34 | 32 МБ |
| Анализ текста | Gemma-2-2B-it Q4_K_M | 1,7 ГБ |
Движки: whisper.cpp, llama.cpp и onnxruntime.
Разговоры с клиентами, врачами, коллегами не должны лежать на чужих серверах. Поэтому VoiceMind всё делает на самом телефоне.
Скачайте APK и установите поверх любой прошлой версии — записи сохранятся. Новости и свежие сборки — в Telegram-канале.