Segmentation en locuteurs de documents audio: Une nouvelle approche basée sur les méthodes a vecteurs support mono classe

Auteurs-es

  • Belkacem Fergani LCPTS - USTHB, B.P. 32,El Alia, Bab Ezzouar, Alger, Algeria
  • Manuel Davy LAGIS/CNRS, Cité Scientifique, BP 48, 59651 Villeneuve d'As cq Cedex, France
  • Amrane Houacine LCPTS - USTHB, B.P. 32,El Alia, Bab Ezzouar, Alger, Algeria

Mots-clés :

Acoustic signal processing, Audio recordings, Data mining, Database systems, Information retrieval, Support vector machines, Digital sound files, Speaker diarization, Text files

Résumé

Avec l’augmentation récente et continue du volume d’archiv es sonores (radio, TV, Web, ...), il devient désormais indispensable de trouver des méthodes efficaces qui permettent de faciliter la recherche d’informations dans les grandes bases de données. Ainsi, on associe aux fichiers audio numérisés des fichiers textuels (fichiers index), de moindre complexité que le fichier signal original, mais contenant néanmoins un résumé des informations recherchées dans ce signal. 45 minutes de parole, 1 minute de musique, 10 locuteurs (6 hommes et 4 femmes) sont un exemple d’informations pertinentes. Ces fichiers d’index stockés en même temps que le signal original, seront d’un apport considérable lors de l’étape de recherche d’informations, permettant alors u n accès direct et immédiat à l’information recherchée. Dans le cas où l’on voudrait savoir qui parle et q uand dans un document sonore, la clé d’indexation est alors le locuteur. Un système d’indexatio n par locuteurs peut servi! r également comme étape préliminaire à des tâches de transcription ou de suivi de locuteurs et représente souvent un facteur important pour l’amélioration des perfo rmances des systèmes de reconnaissance automatique de la parole. Une étape préalable indispensable d’un système d’indexation par locuteurs est la segmentation en locuteurs. Celle-ci consiste à réaliser deux tâches séquentielles: la première étape permet de découper le signal paramétré en intervalles ou segments correspondants à des tours de parole de locuteurs, c’est à dire obtenir des segments les plus longs possibles homogènes en termes de locuteur, puis la deuxième étape consiste à regrouper les segments appartenant à un même locuteur.

Fichiers supplémentaires

Publié-e

2007-12-01

Comment citer

1.
Fergani B, Davy M, Houacine A. Segmentation en locuteurs de documents audio: Une nouvelle approche basée sur les méthodes a vecteurs support mono classe. Canadian Acoustics [Internet]. 1 déc. 2007 [cité 15 sept. 2026];35(4):3-10. Disponible à: https://jcaa.caa-aca.ca/index.php/jcaa/article/view/1974

Numéro

Rubrique

Articles techniques

Articles les plus lus du,de la,des même-s auteur-e-s