Hallucination multimodale / OCR / graphiques
Comprendre
En lisant PDF, scans, tableaux ou graphiques, le modèle fabrique un texte/valeur plausible mais faux au lieu de signaler l'ambiguïté visuelle.
Sous ambiguïté visuelle — flou, faible contraste, tableaux denses — le modèle fabrique une lecture plausible au lieu de signaler qu'il ne voit pas clairement.
Tester
OCR erroné, mauvais lien cellule↔en-tête, lecture fausse d'axe ou de tendance, valeur fabriquée avec assurance sur une image ambiguë.
Ne faites jamais confiance à une lecture d'image sur une décision sans recoupement : redemandez la même valeur sous un autre cadrage, ou vérifiez la source. Sous ambiguïté visuelle, le modèle comble par du plausible.
Lecture de plans scannés, relevés de compteurs par photo, extraction de valeurs sur graphiques de rapport — chaque valeur critique se revérifie hors image.
Prévenir
- › utilisez un vrai OCR et une vraie analyse de tableau.
- › exigez le signalement des lectures peu fiables.
- › vérifiez à la source.
- › Contrôle résiduel : revérifier les valeurs lues sur l'image / OCR / graphique contre la source originale.
Référence
Preuve C (benchmark/outil) — POPE (Li et al., EMNLP 2023, p. 292-305) · HallusionBench (Guan et al., CVPR 2024) · OmniDocBench (Ouyang et al., CVPR 2025) · VHELM (Lee et al., NeurIPS 2024 — S-41) · OCRBench v2 (S-42) — codes S-18/19/20/41/42. NOTE D'AUDIT — v10.13 : groupe éclaté avec venues (POPE, HallusionBench, OmniDocBench vérifiées) ; VHELM confirmée (NeurIPS 2024 D&B) ; OCRBench v2 reste sur le registre S.
Ce qu'elle établit — en lisant PDF, scans, tableaux ou graphiques, le modèle fabrique un texte/valeur plausible mais faux au lieu de signaler l'ambiguïté visuelle — c'est le phénomène mesuré par la source ci-dessus.