Speech Annotator

Выберите файлы или перетащите их в зону ниже — категоризация настраивается индивидуально для каждого файла в открывшемся окне.

Перетащите аудиофайлы сюда

wav · mp3 · ogg · flac · m4a · aac · opus · и другие

Форматы и конвертация

Принимаются любые аудиоформаты: wav, mp3, ogg, flac, m4a, aac, opus, wma, webm, spx и другие.

Все файлы автоматически приводятся к целевому формату через ffmpeg:

  • Частота: 16 000 Гц
  • Каналы: моно
  • Разрядность: 16-bit PCM
  • Фильтр низких частот (highpass 80 Гц)

Убедитесь, что FFMPEG_PATH задан в .env, или ffmpeg доступен в PATH.

Структура хранилища
📁 sources/
 📁 studio/kk/  студийный · казахский
 📁 office/ru/  офисный · русский
 📁 …
 📁 uncategorized/ без категории → в очередь категоризации
📁 chunks/    рабочие чанки аннотатора
Каждый загруженный файл → отдельная папка {тип}/{язык}/{source_uuid}/
Корпуса и дни

Нет записей по выбранным фильтрам

Статистика
Подробная статистика
Распределение статусов чанков
Разметчики
UsernameРольЗавершено

Нет записей по выбранным фильтрам

Поиск датасетов 🤗
Hugging Face Hub · речевые датасеты (ASR). Клик по результату — анализ совместимости.

Введите запрос и нажмите «Найти»

Анализ и импорт
Проверка под архитектуру (16 кГц · моно · 16-bit) и импорт выборки в пул «некатегоризированные».

Выберите датасет в списке слева

Импорт датасета
Стриминг: тянем первые N примеров (0 = всё). «Все языки» — импорт по всем конфигам/локалям датасета. Транскрипт с таймингами заводится как подразметка (сегменты). В режиме «с конкретными параметрами» записи идут сразу в группу и в очередь транскрипции.
Импорт… это может занять время для больших N
.
Загрузка аудио…

Внимание: связь потеряна

Попытка переподключения через 10 сек…