Créateur de PDF interrogeable

Choisissez un PDF numérisé

PDF uniquement · 10 MB

PDF uniquement, jusqu'à 10 Mo et 10 pages

Un PDF scanné n’est en réalité qu’une pile d’images dans un conteneur PDF : impossible de surligner, copier ou rechercher le texte. Cet outil applique la reconnaissance optique de caractères (OCR) à chaque page dans votre navigateur et intègre le résultat comme une couche de texte invisible alignée sur la page d’origine. L’apparence de la page est conservée, tandis que Ctrl+F et la sélection de texte peuvent exploiter les mots reconnus. La reconnaissance peut faire des erreurs et ce résultat n’est pas un PDF d’accessibilité balisé ; vérifiez donc les passages importants avec le scan.

Comment appliquer l'OCR à un PDF scanné

  1. 1

    Envoyez le scan

    Glissez un PDF scanné (contrats, factures, rapports archivés). Le texte imprimé fonctionne mieux ; l'écriture manuscrite, non.

  2. 2

    Choisissez la langue

    Choisissez la langue du document (anglais, espagnol, français, allemand, italien, portugais ou néerlandais) pour que le moteur d'OCR charge le bon modèle de caractères.

  3. 3

    Lancez la reconnaissance

    Chaque page est rendue en haute résolution dans votre navigateur et transmise au moteur d'OCR. Les longs documents peuvent prendre quelques minutes.

  4. 4

    La couche de texte est intégrée

    Les mots reconnus sont placés comme une couche invisible alignée sur la page d'origine, donc chaque page reste inchangée.

  5. 5

    Téléchargez le nouveau PDF

    Obtenez un PDF qui conserve les scans d'origine et devient interrogeable dans tout lecteur moderne.

Quand l’OCR fonctionne bien (et quand non)

La qualité de l’OCR dépend du scan. Comparez toujours les noms, chiffres et formulations juridiques importants avec la page d’origine.

Entrée À quoi vous attendre
Scan propre de texte imprimé Souvent de bons résultats ; relisez les passages importants.
Photo d’une page imprimée Le résultat dépend de la mise au point, de l’éclairage et de l’angle de la page.
Vieux livre ou impression de machine à écrire pâlie Vérifiez soigneusement le texte reconnu.
Écriture manuscrite ou cursive Non prise en charge de manière fiable.
Reçus ou impression thermique Vérifiez soigneusement les chiffres et les caractères pâles.
Fort effet de transparence du verso Les résultats peuvent être incomplets ou inexacts.

PDF interrogeable ou PDF image seule

  • PDF image seule : bitmaps purs, sans texte. Ce que votre scanner produit par défaut.
  • PDF interrogeable : bitmaps plus une couche de texte invisible (ce que génère cet outil). Aspect identique, Ctrl+F fonctionne.
  • PDF/A : un sous-ensemble d’archivage du PDF qui intègre ses polices et interdit les ressources externes, souvent exigé par les tribunaux et les archives. Cet outil produit un PDF interrogeable normal, pas un PDF/A certifié ; convertissez et validez avec un outil PDF/A dédié si votre flux l’exige.

Conseils pour de meilleurs résultats

  • Commencez autour de 300 DPI. C’est souvent un bon équilibre entre détails lisibles et temps de traitement. Une résolution supérieure demande plus de temps et de mémoire.
  • Redressez avant l’OCR. La plupart des scanners proposent une rotation automatique ; une légère inclinaison peut déjà réduire la qualité de la reconnaissance.
  • Une langue par passage. Le moteur ne reconnaît qu’une langue à la fois : choisissez la langue dominante. Pour un document bilingue, lancez-le une fois par langue et gardez le meilleur résultat.
  • Conservez toujours l’original. L’OCR introduit de petites erreurs ; la couche invisible est un confort, pas une preuve.

Questions fréquentes

Le contenu original de la page est conservé. Le texte reconnu y est ajouté sous forme de couche invisible alignée, donc l’apparence de la page devrait rester inchangée. Vérifiez le résultat si une fidélité visuelle exacte est importante.

Sept langues à alphabet latin : anglais, espagnol, français, allemand, italien, portugais et néerlandais. Choisissez celle qui correspond à votre document. Les écritures comme le cyrillique, l’arabe et le CJC (chinois, japonais, coréen) ne sont pas disponibles dans cet outil.

Pas de manière fiable. Cet outil est conçu pour le texte imprimé. La reconnaissance d’écriture manuscrite est une autre technologie : vérifiez ou retranscrivez séparément les documents manuscrits.

Non. Le résultat est un PDF interrogeable normal : vos images de page d’origine plus une couche de texte OCR invisible. Ce n’est pas un fichier PDF/A d’archivage certifié. Si votre flux exige le PDF/A, convertissez et validez le résultat avec un outil PDF/A dédié.

L’OCR s’exécute entièrement dans votre navigateur, donc votre PDF source n’est pas envoyé à un serveur pour la reconnaissance. Un téléchargement local normal reste sur votre appareil. Ce n’est que si vous choisissez Créer une page de téléchargement que le PDF final interrogeable est envoyé sur notre serveur ; le PDF source reste local et le résultat envoyé est conservé jusqu’à 7 jours.

Outils similaires