HRI Facultad de Ingeniería · UNAMTesis de Ingeniería Mecatrónica · 2026

Computación afectiva · Visión artificial · Robótica social

Evaluación de la Interacción Humano‑Robot Basada en Expresiones Faciales Detectadas por CNN

Un sistema que transforma una imagen facial en una estimación emocional para aportar percepción afectiva a futuras interacciones con robots sociales.

Autores Erick Guerrero Martínez · Maya Jily Salgado Miranda Director Ing. Neftalí Elorza López
468 landmarks
CNN · 96×96
6 estados

01 · El proyecto

¿Qué intenta resolver?

La interacción social no depende únicamente de palabras. El rostro comunica información afectiva que un robot necesita percibir si se espera que adapte su comportamiento al estado del usuario.

01

Captura

Se obtiene una imagen del rostro mediante cámara y se localiza la región facial relevante.

02

Percepción

La imagen o sus características geométricas se convierten en información que un modelo puede interpretar.

03

Clasificación

El sistema estima una de seis clases: asombro, disgusto, enojo, felicidad, neutralidad o tristeza.

04

Interacción

Con confianza suficiente, la emoción detectada puede alimentar la lógica de respuesta de un robot social.

02 · Metodología

Del rostro a una decisión

El estudio construyó una base original y comparó enfoques que trabajan directamente con imágenes contra modelos que utilizan geometría facial.

1

Base de datos

Aproximadamente 900 imágenes, cerca de 150 por emoción, capturadas bajo un protocolo controlado.

2

Preprocesamiento

Preparación de las muestras, recorte facial, normalización y versiones de 96 × 96 píxeles para las CNN.

3

Características faciales

MediaPipe Face Mesh permite representar el rostro mediante 468 puntos tridimensionales y derivar características geométricas.

4

Entrenamiento

Se entrenaron cinco modelos con enfoques complementarios: CNN Base, MobileNetV2, MLP, SVM y Random Forest.

5

Evaluación

Los modelos fueron contrastados bajo el mismo conjunto de prueba para comparar exactitud y F1‑score.

03 · Modelos

Cinco maneras de interpretar una expresión

TL

MobileNetV2

Transfer Learning con una red preentrenada y ajuste fino para el conjunto de emociones.

92.78% accuracy
MLP

Perceptrón multicapa

Utiliza los 1404 valores generados por 468 landmarks × 3 coordenadas.

86.67% accuracy
SVM

Kernel RBF

Clasifica 11 características geométricas normalizadas obtenidas del rostro.

98.33% accuracy
RF

Random Forest

Ensamble de 300 árboles aplicado a las mismas 11 características geométricas.

99.44% accuracy

04 · Resultados

Comparación global

El prototipo obtuvo resultados altos dentro de las condiciones controladas del estudio. La propia tesis señala como limitación el tamaño y composición de la base, por lo que estos valores deben entenderse como validación del prototipo y no como desempeño universal.

Accuracy sobre el conjunto de prueba reportado en la tesis.

05 · Demo interactiva

Prueba la CNN Base en tu navegador

La cámara y la inferencia se procesan localmente en tu dispositivo. El video no se transmite al VPS.

Detector listo para iniciar Permite el acceso a la cámara para ejecutar el modelo.
● PROCESAMIENTO LOCAL
Modelo pendiente

¿Qué ocurre en el navegador?
CámaraDetección facialRecorte96×96 grisCNN TFLite6 probabilidades

La demo conserva el modelo modelo_cnn_base.tflite de la implementación original y replica su normalización de píxeles a valores entre 0 y 1. Para localizar el rostro en web se utiliza MediaPipe Face Detection en lugar del Haar Cascade de OpenCV.

Conclusión

Un módulo perceptual para futuras interfaces humano‑robot

La aportación central del trabajo es integrar y comparar diferentes estrategias de reconocimiento de expresiones, además de demostrar su uso en tiempo real como base para sistemas sociales capaces de responder de manera sensible al estado afectivo del usuario.

Consultar documento completo