Captura
Se obtiene una imagen del rostro mediante cámara y se localiza la región facial relevante.
Computación afectiva · Visión artificial · Robótica social
Un sistema que transforma una imagen facial en una estimación emocional para aportar percepción afectiva a futuras interacciones con robots sociales.
01 · El proyecto
La interacción social no depende únicamente de palabras. El rostro comunica información afectiva que un robot necesita percibir si se espera que adapte su comportamiento al estado del usuario.
Se obtiene una imagen del rostro mediante cámara y se localiza la región facial relevante.
La imagen o sus características geométricas se convierten en información que un modelo puede interpretar.
El sistema estima una de seis clases: asombro, disgusto, enojo, felicidad, neutralidad o tristeza.
Con confianza suficiente, la emoción detectada puede alimentar la lógica de respuesta de un robot social.
02 · Metodología
El estudio construyó una base original y comparó enfoques que trabajan directamente con imágenes contra modelos que utilizan geometría facial.
Aproximadamente 900 imágenes, cerca de 150 por emoción, capturadas bajo un protocolo controlado.
Preparación de las muestras, recorte facial, normalización y versiones de 96 × 96 píxeles para las CNN.
MediaPipe Face Mesh permite representar el rostro mediante 468 puntos tridimensionales y derivar características geométricas.
Se entrenaron cinco modelos con enfoques complementarios: CNN Base, MobileNetV2, MLP, SVM y Random Forest.
Los modelos fueron contrastados bajo el mismo conjunto de prueba para comparar exactitud y F1‑score.
03 · Modelos
Procesa directamente rostros en escala de grises de 96 × 96 píxeles mediante tres capas convolucionales.
98.89% accuracyTransfer Learning con una red preentrenada y ajuste fino para el conjunto de emociones.
92.78% accuracyUtiliza los 1404 valores generados por 468 landmarks × 3 coordenadas.
86.67% accuracyClasifica 11 características geométricas normalizadas obtenidas del rostro.
98.33% accuracyEnsamble de 300 árboles aplicado a las mismas 11 características geométricas.
99.44% accuracy04 · Resultados
El prototipo obtuvo resultados altos dentro de las condiciones controladas del estudio. La propia tesis señala como limitación el tamaño y composición de la base, por lo que estos valores deben entenderse como validación del prototipo y no como desempeño universal.
Accuracy sobre el conjunto de prueba reportado en la tesis.
05 · Demo interactiva
La cámara y la inferencia se procesan localmente en tu dispositivo. El video no se transmite al VPS.
La demo conserva el modelo modelo_cnn_base.tflite de la implementación original y replica su normalización de píxeles a valores entre 0 y 1. Para localizar el rostro en web se utiliza MediaPipe Face Detection en lugar del Haar Cascade de OpenCV.
Conclusión
La aportación central del trabajo es integrar y comparar diferentes estrategias de reconocimiento de expresiones, además de demostrar su uso en tiempo real como base para sistemas sociales capaces de responder de manera sensible al estado afectivo del usuario.
Consultar documento completo