Hallucination d'usage d'outils (agentique)
Comprendre
Distinct de la sécurité agentique : l'agent invente des outils/endpoints inexistants, fabrique des arguments JSON, ou appelle un outil quand aucun ne s'applique.
Distinct de la sécurité : l'agent veut agir, alors il invente des endpoints, se trompe d'arguments, ou appelle un outil hors sujet au lieu de reconnaître que la tâche est insoluble.
Tester
appel d'un outil inexistant, arguments mal typés, ou réponse produite « comme si » un outil avait été appelé sans qu'il le soit ; au ④, invention d'un résultat sous pression.
Exigez systématiquement la trace d'appel (quel outil, quels arguments, quel retour) et vérifiez-la : une réponse censée venir d'un outil, mais sans trace, est une hallucination d'usage. Ne présumez jamais qu'un outil a été appelé.
Assistants connectés à des API, à des bases ou à des calculateurs : distinguez ce que le modèle prétend avoir consulté de ce qu'il a réellement appelé — journalisez les appels côté système. Distinct de B84 : B73 est l'appel inventé — un outil ou un paramètre qui n'existe pas. B84 est le résultat fabriqué : l'appel est correct, l'outil échoue, et l'agent narre la réussite.
Prévenir
- › validez les noms et arguments d'outils selon le schéma.
- › autorisez un résultat « aucun outil adapté ».
- › Contrôle résiduel : exiger une preuve d'exécution horodatée pour toute vérification déclarée ; consigner entrée, sortie, outil appelé, statut d'erreur et version, et interdire d'affirmer une vérification non exécutée.
- › face à un paramètre manquant, l'agent devine plutôt que de demander : déclarez la demande de clarification comme une action légitime et attendue du workflow, sans quoi il fabriquera la valeur pour ne pas s'arrêter (B45, B84).
Référence
Preuve C (benchmark/outil) — ToolBeHonest, AgentHarm, Inspect (S-23/45/46) / framework
Ce qu'elles établissent — ToolBeHonest : outil inexistant, hors sujet ou tâche insolvable — l'agent doit le dire (EMNLP 2024) ; AgentHarm documente l'hallucination de paramètres (ICLR 2025).