La reconnaissance optique de caractères (OCR) est l'extraction automatique de texte à partir d'images dans le cadre de la prévention des pertes de données (DLP). L'OCR est une fonctionnalité de la prévention des pertes de données (Advanced DLP).
Formats de fichiers pris en charge pour l'OCR
"BMP_Fmt",
"GIF_87a_Fmt",
"GIF_89a_Fmt",
"ISO_JPEG2000_JP2_Fmt",
"ISO_JPEG2000_JPM_Fmt",
"ISO_JPEG2000_JPX_Fmt",
"JNG_Fmt",
"JPEG_2000_JP2_File_Fmt",
"JPEG_2000_PGX_Fmt",
"JPEG_File_Interchange_Fmt",
"JPEG_XR_Fmt",
"MS_DIB_Fmt",
"PNG_Fmt",
"TIFF_Fmt"
Considérations
À l'heure actuelle, l'anglais est la seule langue prise en charge pour l'extraction avec OCR.
Voici quelques cas où la production peut être affectée :
- Petite taille de police et faible DPI
- Certaines couleurs d'arrière-plan, y compris le texte en surbrillance
- Écriture cursive ou polices de caractères imitant l'écriture cursive
- Images peu claires ou floues et artefacts tels que le bruit dans l'image

