Puntos de referencia
20 published articles
IA local
La paradoja del modelo sin censura: menos rechazo, menos seguridad, y por qué la IA local sigue siendo importante
El benchmark de cinco LLM locales sin censura muestra que la ablación reduce el sobrerrechazo del 44% a casi cero sin afectar el razonamiento, pero la misma edición colapsa los rechazos de seguridad del 41,5% al 9,5%, porque ambos dependen de la misma dirección interna. La verdadera razón para ejecutar sin censura puede no ser la que piensas.
2026-07-19
análisis
Dónde Kimi K3 supera a la frontera: un análisis punto por punto del modelo abierto de 2,8T
Kimi K3, el modelo abierto de 2,8T parámetros de Moonshot AI, va por detrás de los modelos propietarios de frontera en la mayoría de los benchmarks generales, pero lidera en SWE Marathon, Terminal-Bench 2.1, BrowseComp y otros. La tabla detallada revela dónde dan sus frutos sus apuestas arquitectónicas en KDA y Stable LatentMoE.
2026-07-17
Inteligencia Artificial
Lo que Inkling revela sobre la nueva línea divisoria del mercado de modelos de código abierto
Inkling es el primer modelo disponible abiertamente de casi 1 billón de parámetros con entrada nativa de audio, imagen y texto, junto con una ventana de contexto de 1 millón de tokens y una variante cuantizada NVFP4. Los puntajes brutos en los benchmarks son sólidos, pero la historia más reveladora es cómo el ecosistema de código abierto ha pasado de ser un agente de recuperación a una competencia activa en la frontera, y dónde encaja Inkling en ese nuevo mapa.
2026-07-15
Inteligencia artificial
Sonnet 4.6 acaba de hacer que Opus parezca caro. Eso lo cambia todo.
Claude Sonnet 4.6 de Anthropic iguala o supera el rendimiento de clase Opus en puntos de referencia clave, manteniendo el mismo precio que Sonnet 4.5. Los datos de preferencia de desarrolladores y los testimonios de clientes sugieren que el modelo ya está desplazando alternativas más costosas para tareas agénticas y de codificación en el mundo real.
2026-07-14
IA Generativa
CO2Jump de Google combina generación de texto e imagen en un solo paso que se autocorrige sobre la marcha
Google presenta CO2Jump, un muestreador sin entrenamiento para la generación conjunta de texto e imagen. Utiliza un proceso de salto Markoviano autocorrectivo donde las puntuaciones de confianza de cada modalidad guían las actualizaciones de la otra en tiempo real, produciendo resultados multimodales coherentes en un solo paso. El método también incluye tres nuevos conjuntos de datos de referencia para evaluar la generación conjunta.
2026-07-14
Lanzamiento de modelo de IA
Anthropic lanza Claude Sonnet 5: un modelo más agente a un precio competitivo
Anthropic lanza Claude Sonnet 5, un modelo que cierra la brecha con los modelos de clase Opus en tareas de agente como programación, uso de herramientas y razonamiento. Con un precio competitivo, se lanza hoy en todos los planes y la API de Claude.
2026-07-10
Inteligencia Artificial
Kimi K2.7 Code es más rápido y barato. Pero la codificación de código abierto acaba de toparse con un muro llamado GPT-5.5.
El Kimi K2.7 Code de Moonshot AI logra grandes avances en tareas de codificación a largo plazo con un 30 % menos de desperdicio de tokens. Sin embargo, GPT-5.5 y Claude Opus 4.8 siguen liderando en puntos de referencia clave, lo que resalta las compensaciones del mundo real de las decisiones de código abierto.
2026-07-09
Analizando un preprint reciente
Lo que el artículo 2606.23050, de solo cinco días, nos dice sobre el futuro de la IA
Un preprint de 33 páginas, el artículo 2606.23050, publicado hace solo cinco días, marca una contribución seria a la investigación en IA. Este artículo desglosa su metodología, hallazgos clave y lo que señala para la trayectoria del aprendizaje automático y el procesamiento del lenguaje natural.
2026-07-07