SevenTnewS

agentes de código

9 published articles

Google DeepMindFeatured3 min read

El caballo de batalla de Google, más grande en la actualización 3.7

Gemini 3.7 Flash reduce su precio a la mitad y luego lo justifica

El Gemini 3.7 Flash de Google llega a la mitad del precio introductorio del 3.6 Flash mientras afirma mejoras en los puntos de referencia de programación, desarrollo web y trabajo del conocimiento. El lanzamiento se produce tres semanas después del Flash anterior y trae consigo un nuevo argumento de relación precio-rendimiento para desarrolladores de agentes.

2026-08-16

IA4 min read

Multimodal / Código abierto

El paquete de plugins de Qwen le da a tu agente de código ojos, manos y memoria de video

El equipo de Qwen de Alibaba lanzó Qwen-MM-Plugins, un kit de herramientas Apache-2.0 que brinda a los agentes de código habilidades multimodales nativas: lectura de imágenes y video con resolución dinámica, OCR, grounding, ASR, memoria de video largo, generación de video y control de cliente ligero de Blender y FreeCAD. Un solo script lo instala en Claude Code, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.

2026-08-15

Agentes de IA7 min read

Seguridad de terminal

La trampa de '$HOME': los agentes de codificación de IA necesitan sandboxes, no avisos de '¿permitir?'

El sandbox de terminal de Qoder bloquea cerca de un centenar de comandos destructivos de agentes cada día. Los casos detrás de esos bloqueos explican por qué fallan los avisos de '¿permitir?': una carpeta de proyecto llamada $HOME, una limpieza que apuntaba a /root, y un clic que casi cuesta un disco entero.

2026-08-13

IDEs de IA4 min read

Alibaba / IDEs de IA

Por qué Qoder 1.0 abandonó el IDE de espacio de trabajo único

Qoder 1.0 separa los límites de espacio de trabajo, ejecución, artefacto y entrega en worktrees aislados para que las tareas de agentes paralelos dejen de chocar. Los datos A/B propios de Alibaba dicen que su motor de memoria con alcance redujo los tokens de entrada en un 40%.

2026-08-04

IA5 min read

Investigación en IA

Cuando un agente de codificación falla, las repeticiones baratas superan a la escalada, con un 35% del costo

CodeRescue, un sistema de enrutamiento de recuperación para agentes de codificación, utiliza la retroalimentación de ejecución para decidir cuándo reintentar con modelos baratos frente a escalar a modelos costosos. Una capa de control de riesgo conforme permite a los operadores establecer objetivos de costo sin necesidad de reentrenamiento, logrando tasas de resolución casi perfectas con un 35% del costo de la escalada constante.

2026-07-25

Pruebas y BenchmarksFeatured3 min read

Codificación agéntica

Cómo Grok 4.5 se adelantó en el SWE Marathon, y qué significa para los agentes de codificación

Grok 4.5 ahora lidera la tabla de clasificación de SWE Marathon, superando a Claude 4 Opus y GPT-5. El referente evalúa habilidades reales de ingeniería de software: corrección de errores, adición de funciones y comprensión de código en repositorios reales. El resultado redefine el panorama competitivo de los agentes de codificación de IA.

2026-07-20

Mistral AI3 min read

Agentes de IA

Los agentes de codificación de Mistral dejan atrás tu portátil: sesiones paralelas, sin necesidad de supervisión constante

Mistral está trasladando los agentes de codificación a la nube, permitiendo la ejecución de tareas asíncronas y en paralelo mediante el nuevo modelo Mistral Medium 3.5. La actualización introduce agentes remotos en Mistral Vibe y Le Chat, junto con un modo Work para tareas de múltiples pasos, mientras mantiene la supervisión humana para acciones sensibles.

2026-07-12

IAFeatured5 min read

Análisis de evaluación de agentes

ProgramBench: todas las IAs públicas obtienen un 0% en la prueba de codificación más difícil hasta el momento

ProgramBench desafía a los agentes de IA a reconstruir programas solo a partir de binarios, sin código fuente ni descripciones de problemas. Todos los modelos públicos fallan al resolver completamente cualquier tarea, exponiendo debilidades en la exploración, arquitectura y juicio de parada. El benchmark es una prueba de estrés para agentes de codificación que avanzan más allá de los flujos de trabajo basados en parches.

2026-06-29

Pruebas y BenchmarksFeatured3 min read

Rendimiento

Gemma 4 funciona casi un 90 % más rápido en Ollama 0.31 con predicción de múltiples tokens

Ollama 0.31 introduce la predicción de múltiples tokens para Gemma 4 en Apple Silicon, logrando una generación de tokens casi un 90 % más rápida en evaluaciones de codificación. La aceleración proviene de un modelo borrador ajustado automáticamente y un kernel MLX personalizado que elimina lecturas redundantes de pesos.

2026-06-29