Deprecated: Function curl_close() is deprecated since 8.5, as it has no effect since PHP 8.0 in /home/u483256323/domains/poorvam.com/public_html/subdomains/pore/includes/api.php on line 184
Abstract
<jats:p>Актуальность исследования обусловлена ростом потребности в автоматизации ведения протоколов корпоративных встреч, которое является трудоёмким и затяжным процессом, сопровождающимся высоким риском ошибок. Современные системы распознавания речи (ASR –Automatic Speech Recognition) работают нестабильно при многопользовательских диалогах, перекрытиях голосовых фрагментов, фоновом шуме и использовании специализированной лексики. Особенно остро стоит проблема распознавания дикторов (Speaker Identification, SID), когда на одного сотрудника приходится мало эталонных записей, что вполне типично для офисной среды. Дополнительные трудности создаёт и акустическая обстановка: гулкие кабинеты, одновременные высказывания, отсутствие чёткого разделения голосов. Таким образом, цель данной работы – создание гибридной нейросетевой модели для точной транскрипции и надёжной атрибуции речи в групповых дискуссиях. В рамках работы проанализированы слабые места ASR-систем и методов SID, предложена трёхуровневая архитектура: сегментация аудиопотока VAD + SCD (VAD – Voice Activity Detection – определение активности речи), SCD – Speaker Change Detection – детектирование смены диктора), идентификация по голосовым эмбеддингам с механизмом внимания к эталонам, транскрибация[1]с учётом личности говорящего, так же приведено математическое обоснование ключевых компонентов. Теоретическая значимость заключается в построении методики SID на основе механизма внимания, позволяющая эффективно решать задачи обучения с малым числом примеров (few-shot learning). В отличие от традиционных подходов, требующих обширных размеченных корпусов, новая архитектура учится сопоставлять речевые фрагменты с небольшим числом эталонных записей. Эффективность метода эмпирически подтверждена на реальных записях корпоративных совещаний (свыше 20 часов, пять участников). Модуль сегментации показал F1-меру VAD на уровне 0,885, а модуль идентификации диктора точность 62,5%, что в трое выше случайного уровня (20%). Транскрибация выполнена через внешнюю систему Whisper, гарантирующую высокую достоверность распознавания. Результаты позволяют построить систему автоматического ведения протоколов совещаний, а архитектура позволяет работать и с большим числом участников, а также легко адаптируется под разные форматы коммуникаций: от переговоров до встреч с участием клиентов. Функциональные возможности гибридной нейросетевой модели могут быть использованы при создании различных инструментов для протоколирования корпоративных встреч.</jats:p> <jats:p>The relevance of this research stems from the growing need to automate corporate meeting minutes, a labor-intensive and time-consuming process with a high risk of errors. Current speech recognition systems (ASR – Automatic Speech Recognition) perform poorly in multi-user conversations, with overlapping voices, background noise, and the use of specialized vocabulary. Speaker identification (SID – Speaker Identification) is particularly challenging when there are few reference recordings per employee, which is typical in an office environment. Acoustic environments also pose additional challenges: echoing offices, simultaneous speech, and poor voice separation. Therefore, the goal of this study is to develop a hybrid neural network model for accurate transcription and reliable speech attribution in group discussions. This paper analyzes the weaknesses of ASR systems and SID methods and proposes a three-tier architecture: audio stream segmentation (VAD – Voice Activity Detection, SCD – Speaker Change Detection), voice embedding identification with a reference attention mechanism, and speaker-aware transcription. A mathematical justification for the key components is also provided. The theoretical significance lies in the development of an attention-based SID method that effectively solves few-shot learning problems. Unlike traditional approaches that require large labeled corpora, the new architecture learns to match speech fragments with a small number of reference recordings. The effectiveness of the method has been empirically confirmed using real corporate meeting recordings (over 20 hours, five participants). The segmentation module demonstrated a VAD F1 score of 0.885, and the speaker identification module achieved an accuracy of 62.5%, which is three times higher than chance (20%). Transcription was performed using the external Whisper system, which guarantees high recognition accuracy. The results enable the development of a system for automatic meeting minutes, and the architecture supports a large number of participants and is easily adapted to various communication formats: from negotiations to client meetings. The functionality of the hybrid neural network model can be used to create various tools for corporate meeting minutes.</jats:p>