Speech Annotator

  1. Перейдите на страницу Транскрипция и нажмите «Получить кастомный датасет» — это свои записи. Соседние кнопки выдают студийные корпуса: «Получить казахский датасет» (KSC2 и прочая студия на казахском) и «Получить русский датасет» (Golos, OpenSTT и прочая студия на русском).
  2. Прослушайте аудио с помощью плеера.
  3. Добавьте сегменты — нажмите «Добавить сегмент» или выделите регион на осциллограмме.
  4. Для каждого сегмента укажите тип (Речь / Неразборчиво / Шум / Тишина / Не добавлять); для речи — спикера, эмоцию, язык, уверенность и текст; для шума — вид шума.
  5. При необходимости сохраните черновик (Ctrl+S) для продолжения позже.
  6. Сдайте задание (Ctrl+Enter). Транскрипция уйдёт на проверку ревьюеру.

  • Обновите страницу (F5) — иногда аудио не успевает загрузиться.
  • Проверьте подключение к серверу.
  • Убедитесь, что браузер не блокирует автовоспроизведение — нажмите Play вручную.
  • Если проблема повторяется, пропустите чанк и получите следующий.

  • В работе — чанк назначен разметчику
  • На проверке — ожидает ревью
  • Одобрено — принят ревьюером
  • Отклонено — отклонён ревьюером
  • Частично — черновик или пропущен

У каждого задания есть таймер 30 минут. Если время вышло:
  • Чанк автоматически возвращается в пул доступных заданий.
  • Вы можете получить новое задание, нажав любую из кнопок «Получить … датасет».
  • Сохраняйте черновики (Ctrl+S), чтобы не терять прогресс.
КлавишаДействие
SpaceВоспроизведение / Пауза
← / →Перемотка ±5 секунд
Shift + ← / →Точная перемотка ±1 секунда
Ctrl + EnterСдать задание
Ctrl + SСохранить черновик
Ctrl + NДобавить сегмент
Ctrl + ZУдалить последний сегмент
EscПропустить задание (с подтверждением)
?Подсказка горячих клавиш
AОдобрить (страница ревью)
RВернуть на доработку (страница ревью)
XОтклонить (страница ревью)
Правила транскрипции
  • Транскрибируйте "как есть" — сохраняйте фонетические ошибки, разговорные формы, незаконченные слова.
  • Code-switching (суржик) — казахско-русские гибриды фиксируются точно: "баратынмын туда", "сделайшы".
  • Расставляйте пунктуацию по правилам языка: запятые, тире, точки, вопросительные и восклицательные знаки. Каждое предложение — с заглавной буквы, в конце — точка (или ? / !). На распознавание это не влияет, но повышает качество текста датасета.
  • Сегмент никогда не разрывает предложение: он начинается там, где начинается предложение, и заканчивается там, где оно кончается. Длинный монолог делите на сегменты только по границам предложений. Исключение — когда говорящий сам оборвал речь: тогда сегмент кончается на ....
  • Кавычки — только прямые двойные "...", не ёлочки «...» и не „лапки".
  • Количественные числа — цифрами, тысячи через пробел: 5, 500, 20 000, 1 500 000 (не «полтора миллиона»). Дробные — через точку: 1.5, 205.98 (не 1,5). Проценты — знаком: 6%.
  • Порядковые и собирательные числительные — наоборот, СЛОВАМИ: первый, второй, двадцать пятого, бірінші, екінші (не 1-й, не 25-го); двое, трое, екеу. Так их выучила модель.
  • Незавершённые слова пишите как есть: "я хо-", "подо-".
  • Тянущиеся междометия "а"/"э"/"м" пишите буквой, повторённой трижды: ааа, эээ, ммм (не а-а, не Э-э, не м-м). Так их выучила модель. Регистр — по обычной пунктуации: если междометие начинает сегмент или предложение, оно с заглавной (Ааа, понятно.), внутри предложения — строчное (Меня интересует эээ карточка). После многоточия речь не оборвана предложением, поэтому там строчное: изменится... ммм... уровень.
  • Самоисправления: "я думаю… то есть я уверен, что".
  • Временны́е метки — начало и конец относительно начала WAV-файла (секунды). Точность границ важна: по стартам сегментов режутся окна обучения и по ним модель учит таймкоды.
  • Уверенность: high — речь чёткая, medium — слышно, но не всё, low — трудно разобрать.
Паузы и не-речь
СитуацияЧто делать
Пауза/заминка до ~5 секунд Ничего не размечать. Короткие паузы модель учит сама по скачку таймкода следующей реплики. Порог касается ЗАПОЛНИТЕЛЯ паузы (фоновый гул или тишина); отдельный различимый звук — стук, кашель, звонок, скрип — размечается всегда, каким бы коротким он ни был.
Пауза 5 сек – 1 мин (клиент идёт к столу, оператор печатает) Один сегмент: Шум (слышны звуки) или Тишина (реально тихо).
Пауза дольше 1–2 минут (оператор работает за ПК) Размечать блоками по 30–60 секунд (несколько сегментов подряд), НЕ одним куском — иначе часть паузы выпадет из обучения.
Фоновая речь, слова можно разобрать Сегмент Речь со Спикером 3 (или "спикер неясен"), текст дословно.
Фоновая речь слышна, но неразборчива Неразборчиво (со спикером, если понятно кто; без — если нет).
Дальний неразборчивый гул толпы/офиса Считать частью Шума, отдельно не выделять.
"Тишина" vs "Шум"
  • Тишина — РЕАЛЬНАЯ тишина: нет речи и нет различимых звуков; ровный тихий фон комнаты — это ещё тишина. Определяется по СЛЫШИМОМУ, а не по длительности: короткая тишина — тоже тишина. Порог 5 секунд решает другой вопрос — размечать ли паузу вообще (см. таблицу выше), и к выбору между "Тишиной" и "Шумом" отношения не имеет.
  • Шум — есть различимый не-речевой звук: клавиатура, шорох бумаг, гул техники, звонок, скрипнул стул, стукнули по стойке, гул голосов, детский крик. При добавлении сегмента "Шум" выбирается вид шума: офисный фон / клавиатура / клик мыши / канцелярия / тяжёлое оборудование / звонок / скрип / стук / смех / кашель / детский крик / взрослый крик / музыка / другое.
  • Детский крик — плач/крик/визг ребёнка (посетители часто приходят с детьми). Если крик перекрывает речь, но речь всё же разбирается — это по-прежнему Речь соответствующего спикера; отдельный сегмент "Шум · детский крик" ставится там, где речи нет.
  • Взрослый крик — крик/визг взрослого: повышенный тон на грани разборчивости, вскрик. Тот же принцип, что и с детским: разбираете слова — это Речь спикера (при желании с эмоцией "раздражённо"), не разбираете — "Шум · взрослый крик".
  • Тяжёлое оборудование — ровный гул работающей техники: вентиляция, кондиционер, принтер/картомат, электродвигатель. Раньше этот вид назывался "вентиляция" — теперь он покрывает любой машинный гул.
  • Канцелярия — звуки работы с бумагами и письменными принадлежностями: шорох и перелистывание бумаг, скрип фломастера или ручки, щелчок степлера. Раньше этот вид назывался "бумага" — теперь он не только про материал.
  • Клик мыши — отдельный вид, а не «клавиатура». Это единственный звук, по которому слышно, что оператор за столом и работает, пока он молчит: если в записи нет речи, но щёлкает мышь — размечайте именно "Шум · клик мыши" и напишите в комментарии, что происходит. Печать по клавишам — по-прежнему Клавиатура; если слышно и то и другое, выбирайте преобладающий звук.
  • Музыка — радио или фоновая музыка в зале, мелодия ожидания в трубке, музыкальный рингтон. Если поверх музыки идёт разборчивая речь — это Речь спикера, как и с любым другим фоном; отдельный сегмент "Шум · музыка" ставится там, где речи нет. Звонок телефона без мелодии (трель, зуммер) — это Звонок.
  • Скрип vs Стук — по характеру звука, а не по предмету. Скрип — протяжный трущийся звук: дверь, стул, стол. Стук — короткий удар: стукнули по стойке, постучали в дверь, хлопнули дверью. Раньше вместо скрипа был вид "дверь"; хлопки двери теперь идут в "стук".
Главное правило — консистентность. Одинаковые случаи размечаются одинаково ВСЕГДА. Если слышимую фоновую речь иногда размечать, а иногда пропускать — модель учится "через раз игнорировать речь", это хуже любого из двух последовательных вариантов. Порог: "разбираю слова → Речь Спикера N; не разбираю → Неразборчиво/Шум" — и держать его.
Спикеры
  • Номера спикеров сквозные на всю запись: кто был Спикер 1 в начале, тот Спикер 1 до конца (не менять местами в середине). Это обучающий сигнал.
  • Третий голос — полноценный Спикер 3 (или "спикер неясен"), размечать всегда по правилу консистентности. Доступны номера до 10: если в записи очередь, коллега на фоне или посетитель с семьёй — давайте каждому голосу свой номер, а не сваливайте всех в третьего.
  • Не присваивайте реальные имена — только номера в рамках данного файла.
  • Пол и роль — в карточке спикера (значок с человечком над сегментами). Пол ставьте всегда, когда его слышно. Роль («Оператор» / «Клиент» / «Роль не определена») заполняйте на записях, где идёт обслуживание: оператор — тот, кто обслуживает, клиент — кого обслуживают, посторонний голос на фоне — «роль не определена». На короткой записи, где никого не обслуживают, роль не заполняйте вовсе — это не пропуск, а отдельный факт. Пол и роль обучаются: они уезжают составом говорящих в начало комментария к записи («Speaker 1, male, operator»), и по ним потом строится отчёт.
Комментарии

Комментарий — это то, чего нет в словах, но что вы слышите. Модель учится не только расшифровывать речь, но и понимать, что вообще происходило в записи, и учится она именно на ваших комментариях. Их два вида, оба необязательные.

  • Комментарий к сегменту (поле в карточке сегмента, на сегменте любого типа) — что происходит в этом отрезке: КАК это сказано (по слогам, с иронией, шёпотом, передразнивая, сквозь смех), что реально слышно (голос далеко от микрофона, разговор на заднем плане, только щелчки мыши). Например: реплика «У вас нет доступа» — а сказана она по слогам и с явной иронией; это и пишется в комментарий.
  • Комментарий к записи (поле над списком сегментов) — с 2026-08-09 это не свободный текст, а отчёт по записи с фиксированными полями, см. раздел ниже.
  • Нет комментария — оставьте поле пустым. Пустое поле никуда не сохраняется. Не нужно пересказывать словами то, что уже написано в тексте сегмента, и не нужно домысливать то, чего не слышно: выдуманному комментарию модель научится ровно так же, как настоящему.
  • Пишите по-русски, обычным текстом, одной-двумя фразами. Переводы строк и квадратные скобки поле поправит само — они ломают формат датасета. Длина не ограничена, но и растекаться незачем.
Отчёт по записи

Поле «Комментарий к записи» — это отчёт, и он одинаковый у каждой записи: строка на поле, значение из списка. Раньше отчёт писали свободным текстом, и корпус вышел разножанровым — прочитать его машиной невозможно. Шаблон целиком лежит в промте на вкладке «Анализ» модалки «Вставить транскрипцию»: оттуда его удобнее всего и получать.

ОТЧЁТ ПО ЗАПИСИ
Присутствие клиента: подтверждено | не подтверждено | клиент ушёл до конца записи | клиент отсутствует
Тип сессии: обслуживание | служебный разговор | личный разговор | посторонний фон | пустая | технический сбой | смешанная
Полнота записи: полная | обрывается на середине | нет начала | фрагмент
Пригодность для оценки: полная | частичная | непригодна
Тема обращения: <одна фраза>
Итог: решён | решён частично | не решён | переведён/передан | прервано | нет
КРИТИЧЕСКИЕ НАРУШЕНИЯ: ДА | НЕТ
СТАНДАРТНЫЕ НАРУШЕНИЯ: НЕТ | ДА: оператор | ДА: клиент | ДА: оператор и клиент
ТРЕБУЕТ ВНИМАНИЯ: ДА | НЕТ
  • Отчёт есть у каждой записи, даже пустой: для этого в списках и предусмотрены «клиент отсутствует», «пустая», «нет».
  • Состав говорящих писать не нужно — он собирается сам из бейджей спикеров (номер, пол, роль и имя, если человек назвал себя в записи) и встаёт над отчётом.
  • Доли неразборчивого и шума не считайте. Их считает программа по вашим сегментам и показывает во вкладке «Анализ»; в отчёте от вас нужна только категория пригодности.
  • Критические нарушения: «ДА» — и под ним по строке на нарушение, тяжёлое первым: КРИТ-NN | таймкод | короткая цитата или описание. Коды — КРИТ-01…КРИТ-11 (брань, хамство, дискриминация, отказ в обслуживании, обрыв приёма; коррупционные признаки, обход процедуры, посредник, разглашение данных; обесценивание организации, разглашение внутренней информации). Полный список — в том же промте. Критические нарушения — всегда о сотруднике.
  • Стандартные нарушения — то, что нарушает рамки делового общения, но не тянет на критическое: сниженная речь без мата, фамильярность и «ты», флирт и вопросы о личной жизни, разговор не по теме обслуживания, посторонние дела при клиенте, перебивание, агрессия клиента. Коды СТАНД-01…СТАНД-07, и нарушить их может и клиент — поэтому в значении поля назван виновник, а в строке он стоит вторым: СТАНД-NN | оператор или клиент | таймкод | цитата. Строки — по возрастанию таймкода, один код не больше трёх раз.
  • Требует внимания — для того, что настораживает, но не доказано: намёк, на который не ответили; разговор, оборванный на полуслове; вообще всё, чего в кодах нет, но человеку стоит послушать. Строка: код из карты или «—» | таймкод | что настораживает. Сомневаетесь — не в «НЕТ», а сюда: лучше позвать человека послушать, чем записать нарушение, которого не было. Уже записанное выше нарушение здесь не повторяют.
Продолжение разговора

Блок под сегментами. Расшифровкой разговор с моделью не заканчивается: после неё модели задают вопрос о том, что она только что услышала, и она должна на него ответить. Здесь эта пара и пишется — вопрос к модели и ответ модели. Так модель учится не замолкать после транскрипции.

  • Необязательно. Нет пар — блок остаётся пустым, на разметку это не влияет.
  • Пар может быть несколько: их порядок сохраняется, это последовательные ходы одного разговора, а не набор независимых вопросов.
  • Обе половины пары обязательны. Вопрос без ответа модели не на чем учить, а ответ без вопроса не к чему привязать — задание с половинчатой парой не сдаётся, её нужно дописать или удалить.
  • Текст сохраняется дословно: переводы строк, нумерация, отступы — всё доедет до модели как есть. Это специально: список критериев на несколько строк должен выглядеть как список.
  • Ответ пишете вы — это эталон, которому модель должна научиться. Отвечайте по тому, что реально слышно в записи, не додумывая.
Записи
  • Запись доводится до принятия ревьюером до конца файла — частично размеченная запись не попадает в обучение вовсе.
  • Длинные записи (4–10+ минут) ценнее коротких: только они дают примеры "продолжения разговора".
Эмоции
  • neutral — нейтральный тон, деловое общение.
  • excited — возбуждённый, взволнованный.
  • irritated — раздражённый, недовольный.
  • happy — радостный, позитивный.
  • tired — усталый, монотонный.
Политика конфиденциальности и Соглашение NDA

Доступ к данной системе предоставляется только авторизованным сотрудникам, подписавшим соглашение о неразглашении (NDA).

Ваши обязательства:
  • Не распространять, не копировать и не передавать третьим лицам аудиозаписи, транскрипции и любые данные, к которым вы получили доступ.
  • Не обсуждать содержимое записей за пределами рабочего контекста.
  • Немедленно сообщать о случаях несанкционированного доступа или утечки данных.
  • Использовать систему только в целях разметки данных в рамках проекта.
NDA-изоляция:

Разметчики без NDA не видят позицию чанка в исходной записи. Это исключает возможность воссоздать полный разговор.

Ответственность:

Нарушение данного соглашения влечёт за собой немедленное прекращение доступа и может иметь правовые последствия.

Загрузка аудио…

Внимание: связь потеряна

Попытка переподключения через 10 сек…