SevenTnewS

LLMs y Modelos

Grandes modelos de lenguaje: GPT, Claude, Gemini, Mistral y pesos abiertos.

93 published articles

3 min read

Aprendizaje por refuerzo

La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación

El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.

2026-07-30

3 min read

Interpretabilidad Mecanicista

Lo que gemma-4 realmente sabe de física: un nuevo artículo descubre que las representaciones son reales

Una nueva investigación sobre gemma-4-E4B-it revela que las representaciones internas del modelo de los mecanismos de ciencia de materiales están causalmente vinculadas a sus respuestas. El estudio combina múltiples técnicas de sondeo e intervención para demostrar que el conocimiento físico se codifica en transformaciones de estado, no solo en patrones estáticos.

2026-07-29

6 min read

Investigación en IA

Una auditoría revela que las afirmaciones de riesgo del RL distribucional son en su mayoría falsas

Una auditoría a gran escala muestra que los agentes de RL distribucional fabrican sistemáticamente compensaciones de riesgo en los mismos estados donde los profesionales más confiarían en ellos. En QR-DQN, C51 e IQN en MinAtar, ninguna de las afirmaciones más sólidas fue confirmable, y actuar según el consejo de CVaR de los agentes a veces tuvo un rendimiento significativamente peor que el azar.

2026-07-29

4 min read

IA de código abierto

AV-Flamingo de Nvidia aborda la comprensión de videos largos donde la mayoría de los modelos fallan

Nvidia lanza AV-Flamingo, un modelo de lenguaje grande audiovisual abierto diseñado para la comprensión de videos largos y complejos. Utiliza un plan de estudios de tres etapas y un marco de cadena de pensamiento con marcas de tiempo para manejar el razonamiento temporal y multimodal que desconcierta a la mayoría de los modelos.

2026-07-28

1 min read

Ciencia del comportamiento

Las decisiones humanas que los LLM pueden replicar mejor que las encuestas

Un estudio que utiliza 3,000 agentes basados en GPT-5 en experimentos de elección de ruta muestra que los LLM reproducen sesgos de la teoría prospectiva acumulativa, aversión a las pérdidas, dependencia de referencia, ponderación de probabilidad, con alta fidelidad. El enfoque evita el cuello de botella de la estimación de parámetros que limita el modelado conductual tradicional.

2026-07-28

Featured3 min read

Modelos de IA

El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8

Macaron-V1-Venti de MindLab Research lidera las evaluaciones en inteligencia personal, codificación, uso de terminal e IU Generativa, utilizando una novedosa arquitectura Mixture of LoRA que mantiene el modelo compacto a la vez que especializado.

2026-07-27

Featured3 min read

IA de Código Abierto

Kimi K3 es el modelo abierto más grande jamás creado. Pero aún no es el mejor.

Kimi K3 es el modelo abierto más grande con 2,8 billones de parámetros, pero no logra superar a los mejores modelos propietarios en los benchmarks generales. Si bien sobresale en tareas específicas de codificación y agentivas, la brecha con los líderes de frontera como Claude Fable 5 y GPT 5.6 Sol expone los límites del escalado sin avances arquitectónicos y de datos.

2026-07-27

6 min read

Finanzas Agénticas

Se abre la caja negra de tu cartera: dentro del primer rastreador de finanzas agénticas en vivo

NextFund registra cada decisión que un agente de trading de IA toma en mercados en vivo, permitiendo a los usuarios comparar modelos, inspeccionar fundamentos y diagnosticar fallos. Una prueba con ocho LLM en acciones de EE. UU., China y Hong Kong muestra que señales intermedias similares pueden divergir en comportamientos de cartera notablemente diferentes, y que las clasificaciones trimestrales varían según la métrica que más importe.

2026-07-27

3 min read

Investigación en IA

Cuando un grafo sabe lo que no aprendiste: un nuevo modelo de aprendiz

MR-ConceptGCN combina grafos de conocimiento personales con GCN multirrelacionales y embeddings SBERT para producir modelos de aprendizaje secuenciales. En un estudio de 31 personas, mejoró la precisión de las recomendaciones, la utilidad, la diversidad y la satisfacción en comparación con los enfoques de referencia.

2026-07-26

Featured3 min read

Costo vs. capacidad

El modelo de $1.40 que aplastó a su hermano de $2.82 en física

Se pidió a cuatro modelos de IA que construyeran escenas HTML con física real. Opus 5 pasó las tres al menor costo entre los mejores, mientras que Fable 5 falló en cada una al doble del precio.

2026-07-25

Featured4 min read

Investigación

La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva

SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.

2026-07-25

Featured3 min read

Modelos de IA

Claude Opus 5 iguala el rendimiento casi de frontera a la mitad del costo, con un punto ciego deliberado en ciberseguridad

Claude Opus 5 se lanza con puntuaciones casi al nivel de Fable en puntos de referencia de codificación y conocimiento a la mitad del precio. Pero sus capacidades de ciberseguridad deliberadamente debilitadas crean una clara compensación para los desarrolladores.

2026-07-24

← PreviousPage 3 / 8 · 93 articlesNext →