génie logiciel
3 published articles
Analyse de benchmark
Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %
SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.
2026-08-02
Intelligence Artificielle
Qoder d'Alibaba Cloud s'attaque au problème que les outils de codage IA évitent constamment
Alibaba Cloud lance Qoder, un agent de codage IA gratuit axé sur la visibilité de la base de code, la compréhension architecturale et les flux de travail Spec-first pour combler le fossé entre les démos IA virales et les défis réels du génie logiciel.
2026-07-12
Sortie de modèle d'IA
MiniMax lance le modèle M2.7 avec de solides compétences en génie logiciel et en productivité bureautique
Le modèle M2.7 de MiniMax offre des résultats solides dans les benchmarks de génie logiciel et les tâches professionnelles de bureau, avec un taux d'adhésion aux compétences de 97 % sur des instructions complexes et un score ELO de 1495 sur GDPval-AA.
2026-07-08