SevenTnewS

aprendizaje por refuerzo

29 published articles

LLMs y ModelosFeatured4 min read

IA de documentos

Por qué el mejor analizador de documentos ahora cabe en 800 millones de parámetros

El OvisOCR2 de Alibaba, un modelo compacto extremo a extremo de 0.8B, alcanza puntuaciones de última generación en OmniDocBench (96.58) y PureDocBench (75.06), superando a analizadores más grandes basados en pipelines. Su éxito proviene de un motor de datos que mezcla documentos reales filtrados con páginas sintéticas, aprendizaje por refuerzo sobre un profesor de 4B y destilación on-policy en el modelo pequeño.

2026-07-24

Qwen / AlibabaFeatured4 min read

Agentes de codificación con IA

El Qwen-Coder-Qoder de Alibaba supera a Cursor en su propia prueba y reduce el uso de tokens en un 14.5%

El nuevo modelo de codificación de Alibaba, Qwen-Coder-Qoder, supera a Cursor Composer-1 en el benchmark Qoder Bench. Las métricas de producción muestran un aumento del 3.85% en la retención de código, una caída del 61.5% en errores de herramientas y una reducción del 14.5% en el uso de tokens. El modelo se entrena con trazas reales de agentes a través de un marco de recompensa-atacante contra el hackeo de recompensas.

2026-07-23

Sakana AIFeatured1 min read

Aprendizaje biológicamente plausible

Reemplazar MNIST por CIFAR-10 cambia por completo la receta para una IA similar al cerebro

Sakana AI escaló por primera vez una arquitectura compatible con Dale y sin retropropagación más allá de MNIST. El truco: qué técnica importa más se invierte entre conjuntos de datos, una advertencia sobre cómo se mide la IA biológicamente plausible.

2026-07-22

LLMs y ModelosFeatured5 min read

Investigación en IA

Aprendizaje por refuerzo para generación de imágenes: Qwen-Image-2.0-RL obtiene un sistema de recompensa compuesto

El informe técnico de Qwen-Image-2.0-RL detalla un pipeline de post-entrenamiento que combina RLHF, destilación on-policy y modelos de recompensa compuestos para mejorar la calidad de texto a imagen y edición de imágenes. El enfoque produce mejoras medibles en calidad estética, seguimiento de instrucciones y preservación de identidad facial.

2026-07-20

Sakana AI7 min read

IA biológicamente plausible

Una solución rescató a CIFAR-10 y no hizo nada por MNIST, y eso debería inquietar a los investigadores de IA

La difusión de errores de Sakana AI escala el aprendizaje sin retropropagación, similar al cerebro, hasta CIFAR-10 y RL. El problema: qué decisiones de diseño importan se invierte entre puntos de referencia, y el costo del principio de Dale crece con la dificultad de la tarea.

2026-07-19

Laboratorios e InvestigaciónFeatured4 min read

Investigación en IA

La solución de dos palabras para el problema de autosabotaje del aprendizaje por refuerzo

El aprendizaje por refuerzo multitarea tiene un secreto: las señales de recompensa que impulsan la alineación a menudo trabajan en contra. Un equipo internacional acaba de publicar un método que evita que el sistema se enfrente a sí mismo, y cuesta casi nada añadirlo a los procesos existentes.

2026-07-19

LLMs y ModelosFeatured4 min read

IA Embodied

El modelo de 8B de Mistral acaba de hacer opcional el lidar para robots de oficina

Robostral Navigate de Mistral AI es un modelo de 8B que utiliza solo una cámara RGB para lograr un 76,6 % en los benchmarks R2R-CE, superando a los enfoques multisensor en 4,5 puntos. Construido con datos simulados y un método de prefijo-caché eficiente en tokens, se generaliza a través de tipos de robots y se adapta a obstáculos no vistos.

2026-07-17

IAFeatured5 min read

Investigación en IA

El cuello de botella que frena a los agentes de IA no es la exploración, sino la evaluación

Dos nuevos artículos de Hugging Face abordan el mismo problema central desde direcciones opuestas: cómo lograr que los agentes de IA evalúen de forma fiable sus propias acciones. AJ-Bench construye un punto de referencia para agentes jueces conscientes del entorno, mientras que HeavySkill sostiene que el mejor juez reside dentro de los parámetros del modelo.

2026-07-17

LLMs y Modelos4 min read

Inteligencia Artificial

Alibaba acaba de publicar como código abierto un modelo mundial que permite entrenar agentes de IA dentro de un simulador

El equipo Qwen de Alibaba lanzó Qwen-AgentWorld, un modelo mundial de lenguaje que simula entornos de agente en siete dominios. Su proceso de tres etapas, CPT, SFT, RL, produce un simulador que supera a GPT-5.4 en fidelidad y permite a los agentes entrenarse mediante ensayo mental en lugar de costosos despliegues en entornos reales.

2026-07-16

LLMs y Modelos2 min read

Programación competitiva

NousCoder-14B desafía la programación de olimpiadas con un pipeline de RL abierto

Nous Research lanza NousCoder-14B, un modelo de programación competitiva basado en Qwen3-14B mediante RL. Stack abierto completo: pesos, entorno y suite de evaluación. Dirigido a benchmarks de programación de nivel olimpiada.

2026-07-16

IAFeatured5 min read

Inteligencia Artificial

MiniMax M3 y el arte de hacer que un modelo de demostraciones sea resistente al engaño

MiniMax detalla la ingeniería detrás de las capacidades de demostración de M3: un verificador de defensa en profundidad que sobrevivió al modo de fallo por manipulación de recompensas del ciclo M2, y MaxProof, un marco de escalado en tiempo de prueba a nivel de población que convierte el muestreo en una búsqueda guiada. En IMO 2025 y USAMO 2026, M3 con MaxProof supera el umbral humano de medalla de oro.

2026-07-16

Herramientas y FrameworksFeatured2 min read

Herramientas para RL

Tinker-atropos conecta experimentos de RL con el framework Atropos

Nous Research lanza tinker-atropos, una capa de integración entre la API de Tinker y el framework de RL Atropos. Separa los servicios de entrenador, recolección y entorno en componentes desplegables de forma independiente para experimentos de RL más flexibles.

2026-07-16

← PreviousPage 2 / 3 · 29 articlesNext →