Skip to content
 
 

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

PAV - P4: reconocimiento y verificación del locutor

Obtenga su copia del repositorio de la práctica accediendo a Práctica 4 y pulsando sobre el botón Fork situado en la esquina superior derecha. A continuación, siga las instrucciones de la Práctica 3 para crear una rama con el apellido de los integrantes del grupo de prácticas, dar de alta al resto de integrantes como colaboradores del proyecto y crear la copias locales del repositorio.

También debe descomprimir, en el directorio PAV/P4, el fichero db_spk.tgz con la base de datos oral que se utilizará en la parte experimental de la práctica.

Como entrega deberá realizar un pull request con el contenido de su copia del repositorio. Recuerde que los ficheros entregados deberán estar en condiciones de ser ejecutados con sólo ejecutar:

  make release
  run_spkid mfcc train test classerr verify verifyerr

A modo de memoria de la práctica, complete, en este mismo documento y usando el formato markdown, los ejercicios indicados.

Ejercicios.

Extracción de características.

  • Escriba el pipeline principal usado para calcular los coeficientes cepstrales de predicción lineal (LPCC), en su fichero scripts/wav2lpcc.sh:
# A modo de ejemplo de cómo incorporar código fuente a un fichero markdown, el pipeline siguiente
# es el usado para calcular los coeficientes de predicción lineal (LP) en el script wav2lp.sh:
sox $inputfile -t raw - | $X2X +sf | $FRAME -l 400 -p 80 | $WINDOW -l 400 -L 400 |
        $LPC -l 400 -m $lpc_order > $base.lp
  • Escriba el pipeline principal usado para calcular los coeficientes cepstrales en escala Mel (MFCC), en su fichero scripts/wav2mfcc.sh:

  • Indique qué parámetros considera adecuados para el cálculo de los coeficientes LPCC y MFCC.

  • Inserte una imagen mostrando la dependencia entre los coeficientes 2 y 3 de las tres parametrizaciones para una señal de prueba.

    La imagen siguiente es un ejemplo de cómo insertar imágenes en markdown

    • ¿Cuál de ellas le parece que contiene más información?
  • Usando el programa pearson, obtenga los coeficientes de correlación normalizada entre los parámetros 2 y 3, y rellene la tabla siguiente con los valores obtenidos.

    LP LPCC MFCC
    ρx[2,3]
    • Compare los resultados de pearson con los obtenidos gráficamente.

Entrenamiento y visualización de los GMM.

  • Inserte una gráfica que muestre la función de densidad de probabilidad modelada por el GMM de un locutor para sus dos primeros coeficientes de MFCC.

  • Inserte una gráfica que permita comparar los modelos y poblaciones de dos locutores distintos. Comente el resultado obtenido y discuta si el modelado mediante GMM permite diferenciar las señales de uno y otro.

Reconocimiento del locutor.

  • Inserte una tabla con la tasa de error obtenida en el reconocimiento de los locutores de la base de datos SPEECON usando su mejor sistema de reconocimiento para los parámetros LP, LPCC y MFCC.

Verificación del locutor.

  • Inserte una tabla con el score obtenido con su mejor sistema de verificación del locutor en la tarea de verificación de SPEECON. La tabla debe incluir el umbral óptimo, el número de falsas alarmas y de pérdidas, y el score obtenido usando la parametrización que mejor resultado le hubiera dado en la tarea de reconocimiento.

Test final y trabajo de ampliación.

  • Recuerde adjuntar los ficheros class_test.log y verif_test.log correspondientes a la evaluación ciega final.

  • Recuerde, también, enviar a Atenea un fichero en formato zip o tgz con la memoria con el trabajo realizado como ampliación, así como los ficheros class_ampl.log y/o verif_ampl.log, obtenidos como resultado del mismo.

About

PAV - P4: reconocimiento y verificación del locutor

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages