OCR de PDF
Reconnaissez le texte d'un PDF scanné et récupérez un fichier consultable et copiable.
La reconnaissance tourne sur votre appareil : archives et dossiers scannés restent chez vous. Seules les données de langue sont récupérées une fois.
Convertir le résultat indexable en Word
À propos de OCR de PDF
Un PDF scanné est une photographie de document. Vous pouvez le lire, mais rien d'autre ne le peut : la recherche ne trouve rien, la copie ne donne rien, et tout outil travaillant sur du texte se retrouve sans matière. La reconnaissance de texte corrige cela en lisant la forme des lettres et en écrivant ce qu'elle trouve dans le fichier, en couche invisible posée exactement sur les mots imprimés. La page reste identique — le scan n'est pas touché — mais le document devient consultable, sélectionnable et convertible. La reconnaissance tourne dans votre navigateur, en douze langues.
Fonctionnalités
- La reconnaissance tourne dans votre navigateur — les pages ne sont jamais téléversées
- Douze langues, dont le hindi, le russe, le chinois, le japonais et l'arabe
- La couche de texte invisible se pose sur le scan d'origine, laissé intact
- Deux qualités de numérisation, vitesse contre exactitude sur les petits caractères
- Sortie en texte brut en plus du PDF indexable
- Progression par page, avec un arrêt pour les longs documents
- Les données de langue se chargent une fois et restent en cache
Comment utiliser OCR de PDF
- Déposez le PDF scanné sur la page
- Choisissez la langue imprimée et une qualité de numérisation
- Lancez la reconnaissance et suivez la progression
- Téléchargez le PDF indexable, ou seulement le texte reconnu
Exemple
Entrée
1987-minutes.pdf — 8 scanned pages, typewritten English
Sortie
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
La page visible ne change pas ; ce qui change, c'est que les mots sont désormais dans le fichier.
Erreurs courantes et dépannage
- Le texte reconnu est plein d'erreurs. — La reconnaissance dépend du scan. Essayez la qualité supérieure et vérifiez que la langue correspond à la page.
- La reconnaissance est très lente. — C'est un travail réellement lourd, et il se fait sur votre propre processeur. Prenez la qualité rapide et découpez les longs documents.
- Un document bilingue est mal reconnu. — Une langue est utilisée par passe. Découpez le document par langue et fusionnez les résultats.
- L'écriture manuscrite n'a pas été reconnue. — Cet outil reconnaît le texte imprimé et dactylographié. Le manuscrit demande une tout autre classe de modèle.
Foire aux questions
- Le texte reconnu remplace-t-il le scan ?
- Non. L'image reste exactement telle quelle et le texte est ajouté derrière, invisible. C'est ce qui rend un PDF indexable identique à l'original.
- Mes pages scannées sont-elles téléversées pour la reconnaissance ?
- Non. Le moteur tourne dans votre navigateur. Seules les données de langue sont récupérées, une fois, puis mises en cache.
- Combien de pages puis-je reconnaître à la fois ?
- Jusqu'à trente par passe, la reconnaissance étant assez lente pour que les longs documents se traitent mieux par lots.
- Quelle qualité choisir ?
- Commencez par la rapide. Passez à la supérieure si les caractères sont petits ou le scan ancien.
- Puis-je faire une OCR sur un PDF qui a déjà du texte ?
- Vous pouvez, mais c'est inutile : vérifiez d'abord en essayant de sélectionner un mot.
Outils associés
- PDF vers texte — Extrait le texte sélectionnable d’un PDF en texte brut ou en Markdown.
- Numériser en PDF — Utilise la caméra comme scanner et enregistre les pages en PDF.
- PDF en Word — Reconstruit un PDF en document .docx modifiable.
- PDF en Excel — Extrait les tableaux d'un PDF vers un classeur .xlsx ou un CSV.
- PDF en HTML — Convertit un PDF en HTML propre et indexable.
- Compresser un PDF — Réduit un PDF en rerendant chaque page en JPEG à la qualité et à la résolution choisies.
- Résumé de PDF — Résume un long PDF section par section, sur votre appareil.
Tous les outils ArrayKit