Polaridad.
Una Inteligencia artificial capaz de distinguir la emocion de un audio

Analiza las características del audio (pitch, intensidad etc)
Normalmente se utilizan sistemas de video, para analizar el lenguaje corporal de un usuario para que así la IA pueda confabular la mejor respuesta en función del estado emocional del usuario. Sin embargo recientes estudios han demostrado que el análisis de las características del audio, obtiene información más precisa para evaluar el estado emocional del usuario, aunque claro la combinación de audio y video siempre será la mejor opción.
El sistema desarrollado analiza emociones a través del audio combinando un modelo híbrido autoencoder-clasificador con clustering K-Means.
5 clusteres, uno para cada emoción (Alegría, Enfado, Ansiedad, Tristeza y Neutral)

Crecimiento positivo.
Se entrenó con 1.860 archivos de audio extraídos de múltiples datasets públicos, representando cinco emociones básicas (alegría, tristeza, ira, ansiedad y neutral), y extrayendo 209 características acústicas por audio.
La elección de k=5 clusters se justifica tanto empíricamente, ya que Davies-Bouldin presenta un mínimo local en k=5 dentro del rango evaluado, como teóricamente, al corresponderse con las cinco emociones básicas del modelo de Ekman (1972), lo que dota al sistema de interpretabilidad directa.



La evaluación del clustering reveló que el factor más determinante fue el preprocesado. Sustituyendo StandardScaler por RobustScaler, el Silhouette Score pasó de 0.38 a 0.95 (+152%), el Davies-Bouldin bajó de 1.75 a 0.51 (-71%) y el Calinski-Harabasz subió de 399 a 6.325 (+1481%), situando el sistema en categoría «Excelente» en las tres métricas.