Vos fichiers ne quittent jamais votre appareil.Comment ça marche
Comment faire l'OCR d'un PDF
- 1Déposez votre PDF scanné ci-dessus (ou cliquez pour le sélectionner).
- 2Cliquez sur Rendre consultable — chaque page est reconnue à tour de rôle (le moteur OCR se télécharge une fois lors de la première utilisation).
- 3Téléchargez le PDF consultable par recherche.
Questions fréquentes
- Mon fichier est-il téléversé pour l'OCR ?
- Non. La reconnaissance s'exécute entièrement dans votre navigateur grâce à WebAssembly — votre PDF ne quitte jamais votre appareil. Le moteur OCR et les données linguistiques sont téléchargés une fois depuis une source publique (ce sont des logiciels, pas votre fichier), puis mis en cache.
- Que fait l'OCR à mon PDF ?
- Il lit le texte dans les images de page et le rajoute sous forme de couche invisible positionnée par-dessus les mots. La page a toujours le même aspect, mais vous pouvez désormais rechercher, sélectionner et copier le texte dans n'importe quel lecteur de PDF.
- Quelles langues sont prises en charge ?
- L'anglais fonctionne le mieux pour l'instant. Les autres écritures, en particulier non latines comme le chinois, le japonais ou l'arabe, ne sont pas encore prises en charge.
- Pourquoi est-ce lent ?
- L'OCR demande beaucoup de calcul et s'exécute localement sur votre appareil plutôt que sur une ferme de serveurs. Un document long ou en haute résolution peut prendre du temps — c'est le compromis pour garder votre fichier privé.
Transformez une image de texte en texte
Un PDF numérisé n'est en réalité qu'une image — vous pouvez voir les mots mais pas les rechercher, les sélectionner ou les copier. L'OCR (reconnaissance optique de caractères) lit ces images et rajoute le texte sous forme d'une couche invisible posée exactement sur chaque mot. La page paraît identique, mais elle est désormais consultable dans n'importe quel lecteur. HivePDF fait cela directement dans votre navigateur, donc même une numérisation sensible ne quitte jamais votre appareil.
Privé, mais plus lent
La plupart des outils d'OCR téléversent votre document sur un serveur pour effectuer le gros du travail. HivePDF exécute la reconnaissance localement avec WebAssembly à la place. Le moteur OCR et ses données de langue anglaise se téléchargent une fois depuis une source publique — c'est du logiciel, pas votre fichier — puis sont mis en cache pour la prochaine fois. La contrepartie, c'est la vitesse : une numérisation longue ou en haute résolution prend du temps, car c'est votre propre appareil qui fait le travail.
Bon à savoir
Le texte anglais fonctionne le mieux aujourd'hui ; les autres écritures ne sont pas encore prises en charge. Le résultat est une page matricielle plus une couche de texte, donc cela reste une copie fidèle de votre numérisation. Pour réduire le PDF consultable ensuite, utilisez Compresser ; pour extraire les images de page à la place, utilisez PDF vers JPG.
Où l'OCR compte le plus
Les vieilles numérisations, les contrats archivés, ou une pile de paperasse photographiée avec un téléphone sont des candidats courants — rien de tout cela n'est consultable tant que l'OCR n'ajoute pas une couche de texte. Cela compte aussi pour l'accessibilité, puisque les lecteurs d'écran ont besoin de texte réel plutôt que d'une image de texte pour lire une page à voix haute. Une fois traité, le fichier se comporte comme n'importe quel autre PDF consultable : vous pouvez rechercher une clause, copier un paragraphe, ou l'indexer dans une archive documentaire.