VAD и диаризация
VAD (Voice Activity Detection)
Алгоритм, который отвечает на вопрос: «В данный момент в аудио кто-то говорит или там тишина/шум?»
С VAD система обрабатывает только речевые сегменты:
- экономия VRAM (меньше тишины в батче);
- точность таймкодов растёт (нет дрейфа в паузах);
- можно разбить 2-часовой фильм на логические чанки по репликам.
Метрики качества VAD
| Метрика | Что означает |
|---|---|
| False Acceptance | Тишина засчитана как речь |
| False Rejection | Речь пропущена (особенно шепот) |
| Latency | Задержка определения |
Хороший VAD имеет ошибки <5% на чистой речи и <15% в шуме.
CNN или RNN классифицирует короткие фрагменты (20–30 мс):
- Silero VAD — лёгкая модель (~1 MB), работает в реальном времени на CPU.
- Pyannote VAD — точнее, но тяжелее (часть
pyannote.audio). - WebRTC VAD — классика от Google, встроена в браузеры.
Диаризация
Диаризация отвечает: «Кто именно говорит — А или Б?» (многоклассовая).
Лучше делать диаризацию один раз на весь файл (если влезает в RAM), либо использовать более точный VAD перед ней, чтобы не резать реплики пополам.