Claude 4 et le code de longue durée : méthode, contrôles et limites
Comment cadrer un agent de code pendant plusieurs heures sans confondre autonomie et absence de contrôle.

Claude 4 peut travailler longtemps sur un dépôt, mais la durée ne remplace ni le cadrage ni les tests.
- Un agent de code doit commencer par lire le projet avant de modifier des fichiers.
- Les tâches longues deviennent plus fiables quand elles sont découpées en étapes vérifiables.
- Le diff, les tests et les journaux d’exécution restent les preuves à examiner.
Ce que montre l’expérience de sept heures
Dans la vidéo, Claude 4 reçoit une mission de développement qui s’étend sur plusieurs heures. Le point intéressant n’est pas seulement l’endurance du modèle. Il tient surtout à sa capacité à explorer un dépôt, utiliser des outils, modifier plusieurs fichiers et reprendre le travail après un résultat intermédiaire. Cette autonomie reste encadrée par les consignes, les permissions et les contrôles demandés.
Choisir le bon niveau d’autonomie
Le bon modèle dépend du travail à faire, pas d’un classement général.
Tâches longues
Adapté aux migrations, refactorisations transversales et diagnostics qui demandent beaucoup de contexte.
Travail quotidien
Adapté aux corrections ciblées, aux tests, à la documentation et aux changements de taille moyenne.
Contrôle technique
Le modèle propose et exécute. Les tests, le lint, le build et la lecture du diff tranchent.
Limites d’accès
Les secrets, déploiements et actions externes doivent rester protégés par des permissions explicites.
Une méthode simple pour confier un dépôt à un agent
- Décrire un résultat observable, avec les comportements à conserver et les critères de réussite.
- Demander une exploration du dépôt avant toute modification : architecture, dépendances, conventions et tests existants.
- Faire valider un plan pour les changements transversaux.
- Découper la mission : reproduire, tester, corriger, vérifier puis relire le diff.
- Donner les commandes exactes pour les tests, le lint, le typage et le build.
- Interdire les publications, déploiements et changements de secrets sans accord explicite.
Ce qu’il faut vérifier à la fin
Une session longue peut produire un résultat impressionnant et pourtant introduire une régression discrète. Je vérifie les fichiers touchés, la portée réelle du diff, les tests ajoutés, les commandes exécutées et les avertissements ignorés. Si l’agent n’a pas pu lancer une vérification, il doit le dire clairement plutôt que de présenter le travail comme terminé.
Sources et documentation
Questions fréquentes
Claude 4 remplace-t-il le développeur ?
Quel premier test faire avec un agent de code ?
Comment vérifier une mission de plusieurs heures ?
Approfondir les agents IA
Méthodes, essais et limites des agents capables d’exécuter une partie du travail.