IA
Inteligencia artificial: LLMs, agentes, difusión, visión, PLN y lo último de los principales laboratorios.
347 published articles
Puntos de Referencia de IA
GPT-5.4 Lidera el Conjunto de Puntos de Referencia de Matemáticas en 2026 a Medida que los Puntajes de la Frontera se Saturan
GPT-5.4 supera a sus rivales con un barrido de las principales filas de matemáticas de competición, pero GPT-5.2 Pro empata en cada celda y GPT-5.3 Codex ofrece puntajes casi idénticos a un costo menor. El verdadero diferenciador: el rendimiento de los modelos en puntos de referencia de próxima generación como FrontierMath y HMMT Feb 2026.
2026-07-01
Actualización de API
Anthropic aumenta los límites de tasa de la API de Claude y simplifica los niveles a tres
Anthropic aumenta los límites de tasa de la API de Claude para Sonnet y Haiku, simplifica los niveles de uso a tres (Starter, Development, Scale) y garantiza que ninguna organización vea límites más bajos. Los cambios son automáticos.
2026-07-01
Investigación en IA
Un análisis a nivel de token revela que los LLM híbridos destacan en palabras con significado, pero quedan rezagados en repeticiones
Investigadores del Allen Institute for AI compararon Olmo 3 y Olmo Hybrid token por token, encontrando que los híbridos sobresalen en palabras con significado pero no en tokens repetidos. El trabajo sugiere pérdidas de token filtradas como un método de evaluación más rico para arquitecturas de modelos de lenguaje.
2026-07-01
Microsoft Build 2025
Microsoft Discovery ya está disponible de forma general para flujos de trabajo de IA agentiva en ciencia e ingeniería
Microsoft Discovery ya está disponible de forma general, ofreciendo a las organizaciones una plataforma para construir y gobernar flujos de trabajo de IA agentiva para la investigación científica y de ingeniería. La vista previa de la aplicación complementaria Microsoft Discovery tiene como objetivo democratizar el descubrimiento impulsado por IA para los expertos del dominio.
2026-07-01
Benchmark
El GauntletBench de Oxford somete a los agentes de IA a 100 tareas reales. Fallaron el 81% de ellas.
El GauntletBench de Oxford somete a los agentes de IA a 100 tareas desafiantes del mundo real. Los sistemas de frontera apenas alcanzan un 19.1% de éxito, muy por debajo del rendimiento humano. El benchmark se enfoca en capacidades pasadas por alto: percepción temporal, comprensión gráfica y razonamiento 3D en cinco aplicaciones profesionales.
2026-07-01
Inteligencia Artificial
GPT-Live de OpenAI finalmente deja de esperar a que termines de hablar
GPT-Live de OpenAI introduce audio full-duplex para que la IA pueda escuchar y hablar al mismo tiempo. Puede decir 'mjm', esperar durante las pausas y delegar el razonamiento complejo a GPT-5.5 en segundo plano, manteniendo el flujo de la conversación.
2026-07-01
Inteligencia Artificial
El nuevo modelo de DeepSeek pone la eficiencia en el frente de la carrera armamentista de la IA
DeepSeek ha lanzado un nuevo LLM que agudiza su competencia con los principales laboratorios de IA al apostar por la eficiencia sobre la fuerza bruta. El modelo busca ofrecer un rendimiento sólido con un uso optimizado de recursos, reflejando un giro más amplio de la industria hacia una IA rentable.
2026-06-30
Lanzamiento de producto
Claude Sonnet 5 ya está aquí, y Anthropic apuesta por la ciencia y la empresa
Anthropic lanzó Claude Sonnet 5, un modelo más rápido y capaz para codificación y agentes, junto con Claude Science para investigadores y Claude Tag para equipos. La compañía también publicó un marco de política sobre el crecimiento exponencial de la IA.
2026-06-30
contexto efectivo, límites de salida y el impuesto oculto de las ventanas largas
Su modelo de IA dice que puede leer 1 millón de tokens. Miente. Aquí están las matemáticas reales.
Los cuatro LLMs de frontera anuncian contextos de más de 1 millón de tokens, pero la recuperación efectiva, los límites de salida y el costo real difieren considerablemente. DeepSeek V4 Pro lidera en límite de salida y costo, Gemini sobresale por debajo de 200K tokens y Claude Opus gana en almacenamiento en caché para revisión interactiva de código. Este análisis desglosa las cifras de abril de 2026.
2026-06-30
Análisis del lanzamiento de Anthropic
Claude Sonnet 5 hace más difícil justificar la brecha de precio con Opus
Claude Sonnet 5 promete un razonamiento y rendimiento agente casi al nivel de Opus a un costo menor. Los primeros evaluadores reportan mejoras drásticas en la finalización autónoma de tareas y en el seguimiento de operaciones complejas de múltiples pasos. Con precios introductorios hasta agosto de 2026, el modelo hace más difícil justificar la brecha de precio con Opus.
2026-06-30
Análisis de evaluación de agentes
ProgramBench: todas las IAs públicas obtienen un 0% en la prueba de codificación más difícil hasta el momento
ProgramBench desafía a los agentes de IA a reconstruir programas solo a partir de binarios, sin código fuente ni descripciones de problemas. Todos los modelos públicos fallan al resolver completamente cualquier tarea, exponiendo debilidades en la exploración, arquitectura y juicio de parada. El benchmark es una prueba de estrés para agentes de codificación que avanzan más allá de los flujos de trabajo basados en parches.
2026-06-29
Datos sintéticos
Sin jefe, sin cuello de botella: por qué un marco peer-to-peer está repensando la generación de datos sintéticos
Matrix es un marco descentralizado que utiliza mensajes serializados enviados a través de colas distribuidas para la generación de datos sintéticos multiagente. Al eliminar el orquestador central, logra un rendimiento entre 2 y 15 veces mayor en hardware idéntico.
2026-06-06