Investigación en BCI
El aprendizaje por refuerzo mejora en un 41% la decodificación de interfaces cerebro-computadora
Los investigadores proponen CNN-LSTM-RL, un marco de dos etapas que aplica aprendizaje por refuerzo para corregir errores sistemáticos en decodificadores de interfaces cerebro-computadora no invasivas. Sin necesidad de datos neuronales adicionales, el método mejoró la correlación de decodificación de movimiento 3D en un 41,5% y redujo el error cuadrático medio en un 40,2% en diez participantes.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-27 · 4 min de lectura

Decodificar movimientos de extremidades imaginados a partir de señales EEG no invasivas ha estado durante mucho tiempo limitado por el ruido y los errores residuales sistemáticos. Un equipo de la Universidad de Bath y la Universidad del Ulster ha demostrado ahora que un agente de aprendizaje por refuerzo fuera de línea, entrenado únicamente con las salidas del propio decodificador, puede afinar esas trayectorias de manera significativa, sin necesidad de grabaciones neurales adicionales.
En un estudio publicado en arXiv, los investigadores proponen una arquitectura de dos etapas que denominan CNN-LSTM-RL. En la primera etapa, se calibra un modelo de red neuronal convolucional y memoria a corto-largo plazo (CNN-LSTM) con una sola sesión de datos EEG y luego se congela. En la segunda etapa, se entrena fuera de línea un agente de aprendizaje por refuerzo Soft Actor-Critic, utilizando únicamente las salidas cinemáticas predichas por el decodificador y el contexto temporal, para producir correcciones residuales que se suman a las estimaciones de velocidad del decodificador.
Cómo funciona el marco
El agente de RL no accede a las señales EEG ni a las trayectorias objetivo en el momento de la inferencia. Recibe la salida del decodificador, la velocidad corregida previamente y un paso de tiempo normalizado. Su acción es un vector de velocidad residual continuo, escalado de forma independiente por dimensión espacial (x, y, z), que se suma a la predicción del decodificador para obtener la trayectoria corregida final.
La función de recompensa minimiza la distancia euclidiana entre las velocidades corregidas y las trayectorias objetivo reales. Los hiperparámetros se optimizan mediante Optuna en 200 pruebas para maximizar el coeficiente de correlación de Pearson. Esta configuración dual garantiza que las trayectorias corregidas coincidan tanto con la forma del objetivo como que minimicen el error absoluto.
Mejoras de rendimiento en 2D y VR
El equipo evaluó el enfoque en datos de diez participantes en diez sesiones, en entornos de retroalimentación de pantalla 2D y realidad virtual inmersiva (VR). El decodificador base se entrenó en la primera sesión y se mantuvo fijo en cuatro sesiones de prueba posteriores, un protocolo que los autores denominan Generalización del Decodificador Fijo (FDG).
CNN-LSTM-RL logró una correlación media de Pearson de 0,7181 en 2D y 0,7780 en VR, en comparación con 0,5076 y 0,6420 para el decodificador base solo. Esto representa una mejora relativa del 41,5% y el 21,2%. Ambas fueron estadísticamente significativas (p = 0,0005 y p = 0,0059). El error cuadrático medio (RMSE) se redujo de 0,0890 a 0,0532 en 2D (reducción del 40,2%) y de 0,0714 a 0,0441 en VR (reducción del 38,2%), con p < 0,0001 en ambos casos.
En el entorno de VR, el decodificador corregido con RL incluso superó al límite superior dentro de la sesión (WSR), un modelo entrenado y probado en la misma sesión, en RMSE. Esto sugiere que el agente de RL va más allá de lo que la arquitectura CNN-LSTM puede lograr por sí sola.
Ganancias por eje y estabilidad
El análisis eje por eje mostró las mayores ganancias en los ejes Y y Z, donde las correlaciones corregidas superaron 0,97 y el RMSE cayó hasta 0,0182. El marco también presentó una variabilidad de rendimiento entre sesiones mucho menor que cualquier base de referencia, lo que sugiere resiliencia a la no estacionariedad común en los datos EEG longitudinales.
Los tamaños del efecto fueron grandes en todos los casos. Los valores de d de Cohen oscilaron entre 1,85 y 3,45 para las comparaciones de correlación, y entre 2,47 y 4,52 para las reducciones de RMSE. Tanto los análisis paramétricos (ANOVA de medidas repetidas) como los no paramétricos (prueba de Friedman, prueba de rangos con signo de Wilcoxon) confirmaron los resultados.
Limitaciones y trabajo futuro
La corrección residual es sensible al hiperparámetro de escalado de acción: una escala demasiado pequeña limita la mejora, una escala demasiado grande desestabiliza las correcciones. El marco también depende de información temporal explícita; sin la entrada del paso de tiempo, el rendimiento disminuye significativamente, lo que es un problema para aplicaciones de BCI asíncronas en tiempo real.
El estudio actual se limita a una tarea de alcance discreto de cuatro objetivos. Los autores planean expandir la recopilación de datos a un rango más amplio de trayectorias de movimiento y direcciones de destino más densas, y desarrollar estrategias de decodificación invariantes en el tiempo. La implementación en tiempo real con retroalimentación del usuario en vivo también está en la hoja de ruta.
El trabajo se basa en decodificadores CNN-LSTM anteriores del grupo y establece un nuevo punto de referencia para la decodificación no invasiva de imágenes motoras 3D, con aplicaciones potenciales en neurorrehabilitación, prótesis e interacción virtual.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.