LLMs y Modelos
Grandes modelos de lenguaje: GPT, Claude, Gemini, Mistral y pesos abiertos.
93 published articles
Aprendizaje por refuerzo
La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación
El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.
2026-07-30
Interpretabilidad Mecanicista
Lo que gemma-4 realmente sabe de física: un nuevo artículo descubre que las representaciones son reales
Una nueva investigación sobre gemma-4-E4B-it revela que las representaciones internas del modelo de los mecanismos de ciencia de materiales están causalmente vinculadas a sus respuestas. El estudio combina múltiples técnicas de sondeo e intervención para demostrar que el conocimiento físico se codifica en transformaciones de estado, no solo en patrones estáticos.
2026-07-29
Investigación en IA
Una auditoría revela que las afirmaciones de riesgo del RL distribucional son en su mayoría falsas
Una auditoría a gran escala muestra que los agentes de RL distribucional fabrican sistemáticamente compensaciones de riesgo en los mismos estados donde los profesionales más confiarían en ellos. En QR-DQN, C51 e IQN en MinAtar, ninguna de las afirmaciones más sólidas fue confirmable, y actuar según el consejo de CVaR de los agentes a veces tuvo un rendimiento significativamente peor que el azar.
2026-07-29
IA de código abierto
AV-Flamingo de Nvidia aborda la comprensión de videos largos donde la mayoría de los modelos fallan
Nvidia lanza AV-Flamingo, un modelo de lenguaje grande audiovisual abierto diseñado para la comprensión de videos largos y complejos. Utiliza un plan de estudios de tres etapas y un marco de cadena de pensamiento con marcas de tiempo para manejar el razonamiento temporal y multimodal que desconcierta a la mayoría de los modelos.
2026-07-28
Ciencia del comportamiento
Las decisiones humanas que los LLM pueden replicar mejor que las encuestas
Un estudio que utiliza 3,000 agentes basados en GPT-5 en experimentos de elección de ruta muestra que los LLM reproducen sesgos de la teoría prospectiva acumulativa, aversión a las pérdidas, dependencia de referencia, ponderación de probabilidad, con alta fidelidad. El enfoque evita el cuello de botella de la estimación de parámetros que limita el modelado conductual tradicional.
2026-07-28
Modelos de IA
El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8
Macaron-V1-Venti de MindLab Research lidera las evaluaciones en inteligencia personal, codificación, uso de terminal e IU Generativa, utilizando una novedosa arquitectura Mixture of LoRA que mantiene el modelo compacto a la vez que especializado.
2026-07-27
IA de Código Abierto
Kimi K3 es el modelo abierto más grande jamás creado. Pero aún no es el mejor.
Kimi K3 es el modelo abierto más grande con 2,8 billones de parámetros, pero no logra superar a los mejores modelos propietarios en los benchmarks generales. Si bien sobresale en tareas específicas de codificación y agentivas, la brecha con los líderes de frontera como Claude Fable 5 y GPT 5.6 Sol expone los límites del escalado sin avances arquitectónicos y de datos.
2026-07-27
Finanzas Agénticas
Se abre la caja negra de tu cartera: dentro del primer rastreador de finanzas agénticas en vivo
NextFund registra cada decisión que un agente de trading de IA toma en mercados en vivo, permitiendo a los usuarios comparar modelos, inspeccionar fundamentos y diagnosticar fallos. Una prueba con ocho LLM en acciones de EE. UU., China y Hong Kong muestra que señales intermedias similares pueden divergir en comportamientos de cartera notablemente diferentes, y que las clasificaciones trimestrales varían según la métrica que más importe.
2026-07-27
Investigación en IA
Cuando un grafo sabe lo que no aprendiste: un nuevo modelo de aprendiz
MR-ConceptGCN combina grafos de conocimiento personales con GCN multirrelacionales y embeddings SBERT para producir modelos de aprendizaje secuenciales. En un estudio de 31 personas, mejoró la precisión de las recomendaciones, la utilidad, la diversidad y la satisfacción en comparación con los enfoques de referencia.
2026-07-26
Costo vs. capacidad
El modelo de $1.40 que aplastó a su hermano de $2.82 en física
Se pidió a cuatro modelos de IA que construyeran escenas HTML con física real. Opus 5 pasó las tres al menor costo entre los mejores, mientras que Fable 5 falló en cada una al doble del precio.
2026-07-25
Investigación
La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva
SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.
2026-07-25
Modelos de IA
Claude Opus 5 iguala el rendimiento casi de frontera a la mitad del costo, con un punto ciego deliberado en ciberseguridad
Claude Opus 5 se lanza con puntuaciones casi al nivel de Fable en puntos de referencia de codificación y conocimiento a la mitad del precio. Pero sus capacidades de ciberseguridad deliberadamente debilitadas crean una clara compensación para los desarrolladores.
2026-07-24