SevenTnewS

IA

Inteligencia artificial: LLMs, agentes, difusión, visión, PLN y lo último de los principales laboratorios.

565 published articles

3 min read

Estrategia de IA

La apuesta de China por modelos de pesos abiertos divide a Silicon Valley

Mientras que modelos chinos de peso abierto como Kimi K3 igualan a los sistemas frontera estadounidenses en evaluaciones comparativas mientras se ofrecen de forma gratuita, Silicon Valley está dividido: una coalición de 41 empresas defiende la apertura mientras que Anthropic y otros se contienen, y un incidente de seguridad con un modelo rebelde solo agudiza la división.

2026-07-31

4 min read

Resumen de investigación

Los cuellos de botella de razonamiento estructurado superan la magia de los prompts en tareas de inducción de LLM

Una nueva metodología llamada razonamiento Hourglass impone un estricto aislamiento de contexto entre las etapas de inducción, deducción e implementación, pasando solo una regla simbólica comprimida entre ellas. En ARC-AGI-2, aumenta la precisión pass@5 hasta en 14 puntos en comparación con el refinamiento iterativo; en la síntesis de Verilog de ChipBench, casi duplica la precisión con GPT-5.5. Las ablaciones confirman que la topología en sí misma impulsa la mejora.

2026-07-31

4 min read

Frontis-MA1 / OpenMLE

La IA que mejora la IA ahora se ejecuta en una sola RTX 4090

La pila OpenMLE de FrontisAI y el agente Frontis-MA1 de 35B convierten la mejora recursiva en un experimento reproducible. En una sola RTX 4090, el modelo obtiene un 71.21% en MLE-Bench Lite, por delante de GPT-5.5 + Codex y cerca de modelos frontera mucho más grandes.

2026-07-31

4 min read

Destilación de LLM

La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar

Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.

2026-07-31

4 min read

Búsqueda en literatura científica

Los químicos buscan artículos; AskChem responde con 2,4 millones de afirmaciones

AskChem indexa 2,4 millones de afirmaciones químicas de 147.000 artículos, cada una respaldada por un DOI de origen y una cita textual, y las ofrece a científicos y agentes de IA mediante aplicación web, REST, SDK y MCP. En AskChem-Bench, la resolubilidad de DOI para un lector GPT-5.5 pasó del 88,3% al 100%.

2026-07-31

3 min read

Agentes GUI

El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes

El Qwen-UI-Agent de Alibaba Tongyi Lab afirma obtener puntuaciones móviles de última generación (97.5% en AndroidDaily) y resultados competitivos en uso de computadora frente a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Su puntuación en el benchmark de dispositivos reales supera la de sandbox, mientras que el progreso parcial del 40% en OSWorld-v2 es el límite honesto.

2026-07-31

4 min read

Visión por computadora, modelos del mundo e investigación en IA

PhiZero: enseñar a la IA de video a pensar en física antes de renderizar

PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.

2026-07-31

3 min read

Investigación en IA

Memory Decoder: una memoria adicional de 6.9B permite a un modelo de 410M superar a Pythia-12B

Memory Decoder at Scale separa la memoria a largo plazo del razonamiento en los LLM. Una memoria preentrenada de 6.9B elevó a Pythia-410M por encima de Pythia-12B en 17 benchmarks con un 39% menos de parámetros; las memorias de dominio de 1.7B añadieron más de 9 puntos a Qwen3 Base en todas las escalas probadas.

2026-07-31

4 min read

Investigación en IA

La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles

Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.

2026-07-31

4 min read

Evaluación fundamentada vs. no fundamentada

Por qué la autoevaluación de tu modelo de IA falla en la calidad visual

Una nueva investigación introduce la 'fundamentación' como la variable clave que gobierna un tercer eje del cómputo en tiempo de prueba: el escalado de interacción. Los hallazgos muestran que un instrumento determinista que mide el diseño real supera a la evaluación VLM sobre captura de pantalla, arreglando el 40, 74% de los defectos en modalidades visuales mientras la métrica estándar no ve nada.

2026-07-31

3 min read

Investigación en IA

La generación de video se vuelve 120 veces más rápida en una GPU: el avance de Nvidia en atención híbrida

El SANA-Video 2.0 de Nvidia Research combina atención lineal y softmax periódica en una proporción 3:1 para funcionar 120 veces más rápido que Wan 2.2 en una H100. El diseño híbrido recupera la expresividad de rango completo mientras mantiene la inferencia en 13 segundos para un clip en 720p. Las advertencias: los benchmarks se detienen en 720p y combinan el cambio de atención con optimizaciones propietarias.

2026-07-31

4 min read

Política de IA

El matizado punto medio de Anthropic sobre los modelos de IA de pesos abiertos

Amodei describe dos escenarios de pesadilla: la superioridad militar autoritaria y los riesgos de mal uso, y argumenta que las prohibiciones generales de los modelos de pesos abiertos no abordan el verdadero problema.

2026-07-31

← PreviousPage 12 / 48 · 565 articlesNext →