aprendizaje por refuerzo
29 published articles
IA de documentos
Por qué el mejor analizador de documentos ahora cabe en 800 millones de parámetros
El OvisOCR2 de Alibaba, un modelo compacto extremo a extremo de 0.8B, alcanza puntuaciones de última generación en OmniDocBench (96.58) y PureDocBench (75.06), superando a analizadores más grandes basados en pipelines. Su éxito proviene de un motor de datos que mezcla documentos reales filtrados con páginas sintéticas, aprendizaje por refuerzo sobre un profesor de 4B y destilación on-policy en el modelo pequeño.
2026-07-24
Agentes de codificación con IA
El Qwen-Coder-Qoder de Alibaba supera a Cursor en su propia prueba y reduce el uso de tokens en un 14.5%
El nuevo modelo de codificación de Alibaba, Qwen-Coder-Qoder, supera a Cursor Composer-1 en el benchmark Qoder Bench. Las métricas de producción muestran un aumento del 3.85% en la retención de código, una caída del 61.5% en errores de herramientas y una reducción del 14.5% en el uso de tokens. El modelo se entrena con trazas reales de agentes a través de un marco de recompensa-atacante contra el hackeo de recompensas.
2026-07-23
Aprendizaje biológicamente plausible
Reemplazar MNIST por CIFAR-10 cambia por completo la receta para una IA similar al cerebro
Sakana AI escaló por primera vez una arquitectura compatible con Dale y sin retropropagación más allá de MNIST. El truco: qué técnica importa más se invierte entre conjuntos de datos, una advertencia sobre cómo se mide la IA biológicamente plausible.
2026-07-22
Investigación en IA
Aprendizaje por refuerzo para generación de imágenes: Qwen-Image-2.0-RL obtiene un sistema de recompensa compuesto
El informe técnico de Qwen-Image-2.0-RL detalla un pipeline de post-entrenamiento que combina RLHF, destilación on-policy y modelos de recompensa compuestos para mejorar la calidad de texto a imagen y edición de imágenes. El enfoque produce mejoras medibles en calidad estética, seguimiento de instrucciones y preservación de identidad facial.
2026-07-20
IA biológicamente plausible
Una solución rescató a CIFAR-10 y no hizo nada por MNIST, y eso debería inquietar a los investigadores de IA
La difusión de errores de Sakana AI escala el aprendizaje sin retropropagación, similar al cerebro, hasta CIFAR-10 y RL. El problema: qué decisiones de diseño importan se invierte entre puntos de referencia, y el costo del principio de Dale crece con la dificultad de la tarea.
2026-07-19
Investigación en IA
La solución de dos palabras para el problema de autosabotaje del aprendizaje por refuerzo
El aprendizaje por refuerzo multitarea tiene un secreto: las señales de recompensa que impulsan la alineación a menudo trabajan en contra. Un equipo internacional acaba de publicar un método que evita que el sistema se enfrente a sí mismo, y cuesta casi nada añadirlo a los procesos existentes.
2026-07-19
IA Embodied
El modelo de 8B de Mistral acaba de hacer opcional el lidar para robots de oficina
Robostral Navigate de Mistral AI es un modelo de 8B que utiliza solo una cámara RGB para lograr un 76,6 % en los benchmarks R2R-CE, superando a los enfoques multisensor en 4,5 puntos. Construido con datos simulados y un método de prefijo-caché eficiente en tokens, se generaliza a través de tipos de robots y se adapta a obstáculos no vistos.
2026-07-17
Investigación en IA
El cuello de botella que frena a los agentes de IA no es la exploración, sino la evaluación
Dos nuevos artículos de Hugging Face abordan el mismo problema central desde direcciones opuestas: cómo lograr que los agentes de IA evalúen de forma fiable sus propias acciones. AJ-Bench construye un punto de referencia para agentes jueces conscientes del entorno, mientras que HeavySkill sostiene que el mejor juez reside dentro de los parámetros del modelo.
2026-07-17
Inteligencia Artificial
Alibaba acaba de publicar como código abierto un modelo mundial que permite entrenar agentes de IA dentro de un simulador
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld, un modelo mundial de lenguaje que simula entornos de agente en siete dominios. Su proceso de tres etapas, CPT, SFT, RL, produce un simulador que supera a GPT-5.4 en fidelidad y permite a los agentes entrenarse mediante ensayo mental en lugar de costosos despliegues en entornos reales.
2026-07-16
Programación competitiva
NousCoder-14B desafía la programación de olimpiadas con un pipeline de RL abierto
Nous Research lanza NousCoder-14B, un modelo de programación competitiva basado en Qwen3-14B mediante RL. Stack abierto completo: pesos, entorno y suite de evaluación. Dirigido a benchmarks de programación de nivel olimpiada.
2026-07-16
Inteligencia Artificial
MiniMax M3 y el arte de hacer que un modelo de demostraciones sea resistente al engaño
MiniMax detalla la ingeniería detrás de las capacidades de demostración de M3: un verificador de defensa en profundidad que sobrevivió al modo de fallo por manipulación de recompensas del ciclo M2, y MaxProof, un marco de escalado en tiempo de prueba a nivel de población que convierte el muestreo en una búsqueda guiada. En IMO 2025 y USAMO 2026, M3 con MaxProof supera el umbral humano de medalla de oro.
2026-07-16
Herramientas para RL
Tinker-atropos conecta experimentos de RL con el framework Atropos
Nous Research lanza tinker-atropos, una capa de integración entre la API de Tinker y el framework de RL Atropos. Separa los servicios de entrenador, recolección y entorno en componentes desplegables de forma independiente para experimentos de RL más flexibles.
2026-07-16