IA
Inteligencia artificial: LLMs, agentes, difusión, visión, PLN y lo último de los principales laboratorios.
565 published articles
Estrategia de IA
La apuesta de China por modelos de pesos abiertos divide a Silicon Valley
Mientras que modelos chinos de peso abierto como Kimi K3 igualan a los sistemas frontera estadounidenses en evaluaciones comparativas mientras se ofrecen de forma gratuita, Silicon Valley está dividido: una coalición de 41 empresas defiende la apertura mientras que Anthropic y otros se contienen, y un incidente de seguridad con un modelo rebelde solo agudiza la división.
2026-07-31
Resumen de investigación
Los cuellos de botella de razonamiento estructurado superan la magia de los prompts en tareas de inducción de LLM
Una nueva metodología llamada razonamiento Hourglass impone un estricto aislamiento de contexto entre las etapas de inducción, deducción e implementación, pasando solo una regla simbólica comprimida entre ellas. En ARC-AGI-2, aumenta la precisión pass@5 hasta en 14 puntos en comparación con el refinamiento iterativo; en la síntesis de Verilog de ChipBench, casi duplica la precisión con GPT-5.5. Las ablaciones confirman que la topología en sí misma impulsa la mejora.
2026-07-31
Frontis-MA1 / OpenMLE
La IA que mejora la IA ahora se ejecuta en una sola RTX 4090
La pila OpenMLE de FrontisAI y el agente Frontis-MA1 de 35B convierten la mejora recursiva en un experimento reproducible. En una sola RTX 4090, el modelo obtiene un 71.21% en MLE-Bench Lite, por delante de GPT-5.5 + Codex y cerca de modelos frontera mucho más grandes.
2026-07-31
Destilación de LLM
La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar
Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.
2026-07-31
Búsqueda en literatura científica
Los químicos buscan artículos; AskChem responde con 2,4 millones de afirmaciones
AskChem indexa 2,4 millones de afirmaciones químicas de 147.000 artículos, cada una respaldada por un DOI de origen y una cita textual, y las ofrece a científicos y agentes de IA mediante aplicación web, REST, SDK y MCP. En AskChem-Bench, la resolubilidad de DOI para un lector GPT-5.5 pasó del 88,3% al 100%.
2026-07-31
Agentes GUI
El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes
El Qwen-UI-Agent de Alibaba Tongyi Lab afirma obtener puntuaciones móviles de última generación (97.5% en AndroidDaily) y resultados competitivos en uso de computadora frente a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Su puntuación en el benchmark de dispositivos reales supera la de sandbox, mientras que el progreso parcial del 40% en OSWorld-v2 es el límite honesto.
2026-07-31
Visión por computadora, modelos del mundo e investigación en IA
PhiZero: enseñar a la IA de video a pensar en física antes de renderizar
PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.
2026-07-31
Investigación en IA
Memory Decoder: una memoria adicional de 6.9B permite a un modelo de 410M superar a Pythia-12B
Memory Decoder at Scale separa la memoria a largo plazo del razonamiento en los LLM. Una memoria preentrenada de 6.9B elevó a Pythia-410M por encima de Pythia-12B en 17 benchmarks con un 39% menos de parámetros; las memorias de dominio de 1.7B añadieron más de 9 puntos a Qwen3 Base en todas las escalas probadas.
2026-07-31
Investigación en IA
La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles
Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.
2026-07-31
Evaluación fundamentada vs. no fundamentada
Por qué la autoevaluación de tu modelo de IA falla en la calidad visual
Una nueva investigación introduce la 'fundamentación' como la variable clave que gobierna un tercer eje del cómputo en tiempo de prueba: el escalado de interacción. Los hallazgos muestran que un instrumento determinista que mide el diseño real supera a la evaluación VLM sobre captura de pantalla, arreglando el 40, 74% de los defectos en modalidades visuales mientras la métrica estándar no ve nada.
2026-07-31
Investigación en IA
La generación de video se vuelve 120 veces más rápida en una GPU: el avance de Nvidia en atención híbrida
El SANA-Video 2.0 de Nvidia Research combina atención lineal y softmax periódica en una proporción 3:1 para funcionar 120 veces más rápido que Wan 2.2 en una H100. El diseño híbrido recupera la expresividad de rango completo mientras mantiene la inferencia en 13 segundos para un clip en 720p. Las advertencias: los benchmarks se detienen en 720p y combinan el cambio de atención con optimizaciones propietarias.
2026-07-31
Política de IA
El matizado punto medio de Anthropic sobre los modelos de IA de pesos abiertos
Amodei describe dos escenarios de pesadilla: la superioridad militar autoritaria y los riesgos de mal uso, y argumenta que las prohibiciones generales de los modelos de pesos abiertos no abordan el verdadero problema.
2026-07-31