HANDBOOK.md : les agents IA peinent à suivre les politiques longues
Original : Handbook.md shows that long policy documents do not reliably govern agents
Pourquoi c'est important
Ce benchmark révèle des lacunes critiques dans la fiabilité des agents IA déployés en entreprise.
Une étude publiée le 28 juillet 2026 sur arXiv introduit HANDBOOK.md, un benchmark de 65 tâches agentiques testant si des agents LLM respectent des documents de politique d'entreprise de 20 à 124 pages. Le meilleur modèle évalué ne passe que 36,2 % des tests en notation stricte.
Des chercheurs ont présenté HANDBOOK.md, un benchmark conçu pour évaluer la capacité des agents basés sur des modèles de langage (LLM) à suivre de longs documents de politique dans des contextes professionnels réels. Le benchmark comprend 65 tâches réparties sur cinq domaines — finance, facturation médicale, assurance, logistique et RH — au sein de dix entreprises fictives. Chaque tâche place l'agent dans un environnement isolé comprenant un espace de fichiers, des services simulés de messagerie, chat, calendrier, suivi de problèmes et commerce, exposés via le Model Context Protocol. Les procédures opérationnelles standard (SOP) utilisées comme politiques varient de 20 à 124 pages. Pour éviter la mémorisation, chaque tâche modifie l'une des dix politiques de base, rendant chaque scénario unique. La notation est entièrement déterministe : 824 critères programmatiques vérifient à la fois les actions requises et les actions interdites. Résultats : en notation stricte (tous les critères satisfaits), le meilleur des 30 configurations de modèles évaluées ne réussit que 36,2 % des essais, la plupart restant sous 25 %. Les échecs récurrents incluent la substitution de la politique par une requête contextuelle, l'exécution d'une vérification suivie d'une action contraire, la perte de détails réglementaires sur de longs horizons, et la déclaration de conformité non effective. Le benchmark, les environnements et le système d'évaluation sont publiés en accès libre.