VoiceMind
Диктофон для Android

Диктофон, который понимает

VoiceMind сам расшифровывает речь, делит разговор по голосам и выписывает из него задачи. Всё считается на телефоне — запись никуда не отправляется, интернет нужен только чтобы один раз скачать модели.

  • Работает без интернета
  • Записи остаются на телефоне
  • Русский и английский

Что умеет

Не просто текст из аудио: VoiceMind помогает разобраться, кто что сказал и о чём договорились.

Расшифровка офлайн

Записывает и расшифровывает русскую и английскую речь, язык можно определять автоматически. Текст появляется прямо во время записи.

Разделение по голосам

Делит разговор по собеседникам. Можно указать, сколько было человек, и дать им имена.

Задачи и итоги

Локальная нейросеть выписывает задачи, встречи и договорённости. Шаблоны итогов: встреча, приём, консультация, интервью, лекция.

Вопросы по записи

Спросите, о чём договорились или что сказал конкретный человек, — ответ строится по тексту этой записи.

Импорт аудио

Расшифровывает готовые файлы: голосовые из Telegram и WhatsApp, записи диктофона, mp3, m4a, ogg, wav. В Telegram — «Поделиться» → «Расшифровать в VoiceMind».

Мой словарь

Добавьте имена, названия и редкие термины — распознавание будет писать их правильно.

Сомнительные слова

Подсвечивает места, где распознавание не уверено: нажали на слово — услышали этот фрагмент. Текст можно поправить.

История и поиск

Записи хранятся по дням, по ним работает поиск. Экспорт в Markdown, PDF и DOCX.

Напоминания о встречах

По желанию подключается к Яндекс Календарю и напоминает о встречах, найденных в записях.

Как это работает

Внутри — открытые нейросети, которые запускаются прямо на процессоре телефона, а если подходит видеокарта — на ней.

  1. Запись или файл

    Нажмите большую кнопку или откройте готовое аудио. Паузы пропускаются, длинная запись распознаётся кусками прямо во время диктовки.

  2. Распознавание

    Whisper large-v3-turbo, дообученный на русском (whisper-podlodka-turbo), превращает речь в текст.

  3. Кто говорит

    Модели pyannote и WeSpeaker делят разговор по голосам собеседников.

  4. Анализ

    Локальная языковая модель Gemma-2-2B выписывает задачи, собирает итоги по шаблону и отвечает на вопросы по записи.

Для чегоМодельРазмер
Распознавание, режим «Точно»whisper-podlodka-turbo (Whisper large-v3-turbo), q4_0474 МБ
Распознавание, режим «Быстро»whisper-small q5_1190 МБ
Поиск речи в записиSilero VAD0,9 МБ
Разделение по голосамpyannote segmentation-3.0 + WeSpeaker ResNet3432 МБ
Анализ текстаGemma-2-2B-it Q4_K_M1,7 ГБ

Движки: whisper.cpp, llama.cpp и onnxruntime.

Ваши разговоры — только ваши

Разговоры с клиентами, врачами, коллегами не должны лежать на чужих серверах. Поэтому VoiceMind всё делает на самом телефоне.

  • Аудио и текст не покидают телефон. Распознавание и анализ идут локально, записи не попадают в резервные копии Google.
  • Работает без сети. Интернет нужен один раз — скачать модели. Их можно и перекинуть с компьютера: приложение проверит файл по контрольной сумме.
  • На сервер — только email и статус подписки. Ни звука, ни текста записей.

Попробуйте VoiceMind

Скачайте APK и установите поверх любой прошлой версии — записи сохранятся. Новости и свежие сборки — в Telegram-канале.

  • Android 8.0 и новее
  • ~600 МБ свободного места
  • +1,7 ГБ для анализа текста