NXL Forge.Pendant que le marché rédige — nous livrons
00Blog

Notes Odoo, IA, méthode.

Actualité Odoo le mardi, technique Odoo le jeudi, IA appliquée au développement le reste de la semaine. Filtrer par thème ou rechercher ci-dessous.

6 articles pour « SWE-bench »

IA & Codage25 août 2026· 4 min de lecture

Quand l’agent de code annonce « terminé » à tort

Un agent de code qui annonce « terminé » n’a pas forcément résolu la tâche. Deux études publiées en 2026 chiffrent ces fausses réussites, souvent invisibles car le code passe les tests. Pour une PME, le coût réel se déplace vers la correction humaine.

agents de codefiabilitéIArevue de code
IA & Codage6 juillet 2026· 5 min de lecture

SWE-bench à 95 % : ce que le score d'un agent de code ne dit pas

Un éditeur affiche 95 % sur SWE-bench pour vendre son agent de code. Ce benchmark est pourtant saturé et contaminé, au point qu'OpenAI a cessé de le publier début 2026. On explique comment lire ces scores avant de choisir un outil.

agents de codebenchmarksSWE-benchoutillage dev
IA & Codage8 juin 2026· 4 min de lecture

Le code que les agents IA produisent vieillit mal

Un benchmark publié cette semaine mesure ce que devient le code des agents IA après dix itérations. Verdict : il se dégrade quand le code humain, lui, reste stable. Conséquences pour qui maintient du logiciel Odoo dans la durée.

IA et codageagents IAbenchmarksdette technique
Article de fond29 mai 2026· 5 min de lecture

Opus 4.8 transforme Claude Code en chef d'orchestre. On a regardé sous le capot

Le 28 mai, Anthropic a sorti Opus 4.8 et les Dynamic Workflows : Claude Code peut désormais lancer des centaines de sous-agents en parallèle sur une seule session. Le benchmark phare parle d'une migration de 750 000 lignes en 11 jours. Lecture côté studio, réserves comprises.

opus-4-8claude-codedynamic-workflowsagents-ia
Article de fond17 avril 2026· 8 min de lecture

Claude Opus 4.7 : ce qui change vraiment dans un workflow SaaS

Anthropic a sorti Opus 4.7. Sur le papier, une incrémentation. Dans un workflow de studio qui livre en production, plusieurs changements obligent à retoucher prompts, budgets tokens et permissions Claude Code.

claude-opus-4-7anthropicia-codageclaude-code
Article de fond10 avril 2026· 8 min de lecture

Claude Mythos : le modèle qu'on ne peut pas avoir change déjà tout

Anthropic vient de dévoiler Mythos, son modèle le plus puissant à ce jour — et refuse de le rendre public. Pour les builders SaaS, ce n'est pas juste une annonce sécurité. C'est un avant-goût de ce à quoi le développement va ressembler dans six mois.

claude-mythosia-codageanthropicsécurité