Extraire les numéros de téléphone du texte

Collez tout texte qui mélange prose, signatures ou HTML récupéré, et extrayez chaque numéro de téléphone qu’il contient. L’extracteur reconnaît les formats nord-américains (xxx) xxx-xxxx, les formes européennes séparées par des espaces, les formats internationaux compacts +CC..., et les styles lâches que les gens tapent dans les e-mails (555.123.4567, +44 20 7946 0958). La sortie est renvoyée dans la forme dans laquelle elle a été trouvée, vous pouvez donc normaliser plus tard avec une bibliothèque comme libphonenumber.

Comment extraire des numéros de téléphone

  1. 1

    Collez la source

    Déposez le texte : pages de contact, signatures d'e-mail, exports CSV, journaux de chat.

  2. 2

    Lancez l'analyse

    Le regex parcourt le texte à la recherche de séquences de chiffres avec au moins 7 chiffres plus des séparateurs ou des codes de pays reconnaissables.

  3. 3

    Examinez les correspondances

    Les résultats affichent un candidat par ligne, les doublons étant supprimés automatiquement. Passez la liste en revue pour repérer les faux positifs (numéros de commande, dates) et corrigez le texte source si quelque chose s'est glissé.

  4. 4

    Copiez ou exportez

    Récupérez la liste propre sous forme de texte brut, un numéro par ligne, prête pour votre CRM ou votre composeur.

Formes de numéros de téléphone qu'il reconnaît

Les numéros de téléphone sont désordonnés car chaque pays a sa propre convention et les gens ignorent de toute façon les règles. L’extracteur cible les formes pratiques que vous voyez dans le texte réel.

Formats acceptés (exemple)

Format Exemple Remarques
E.164 +14155552671 Référence absolue ; utilisez ceci pour le stockage.
International espacé +44 20 7946 0958 Ligne fixe au Royaume-Uni avec groupes séparés par des espaces.
Nord-Américain NANP (415) 555-2671 Parenthèses autour de l’indicatif régional.
Nord-Américain pointillé 415.555.2671 Commun dans les signatures d’e-mail.
Local européen 020 7946 0958 Zéro initial (préfixe interurbain).
Mexicain 10 chiffres 55 1234 5678 Pas de code de pays.

Faux positifs à surveiller

  • Numéros de commande et de suivi. Un numéro de suivi FedEx à 13 chiffres peut ressembler à un numéro de téléphone s’il est écrit avec des espaces. Inspectez le contexte environnant.
  • Dates. 2024 09 15 peut correspondre à un motif de 7+ chiffres selon le mode regex. Filtrez d’abord les dates si votre source est riche en dates.
  • Numéros de carte de crédit. Des groupes de 16 chiffres au format 4xxx xxxx xxxx xxxx peuvent correspondre. Masquez au préalable les données PCI avant l’extraction.

Astuce : normalisez avant de stocker

Différentes saisies pour le même numéro réel sont à l’origine des casse-tête de déduplication dans le CRM. Un passage rapide avec une bibliothèque qui comprend les règles de pays (libphonenumber, phonenumbers en Python, laravel-phone en PHP) convertira tout en E.164, le seul format que vous devriez conserver dans une base de données.

Questions fréquentes

L’extracteur renvoie la correspondance brute ; l’inférence de pays nécessite un pack de données de codes de numérotation et de règles de longueur. Si vous ne vous souciez que du préfixe +CC, cette portion est préservée telle quelle dans la sortie.

L’extracteur renvoie uniquement le numéro principal ; une extension en ligne comme 555-2671 ext. 123 ne fait pas partie de la correspondance. Pour un stockage strict en E.164, séparez tout ce qui suit ext, x ou # dans un champ dédié.

Oui, les numéros sans frais américains (800, 888, 877, 866, 855, 844, 833) correspondent au motif normal NANP. Les formes locales sans frais 0800 au Royaume-Uni et similaires passent également car elles ressemblent à des lignes fixes régulières.

Aucune copie de votre entrée n’est conservée une fois la réponse d’extraction renvoyée ; le traitement se fait en mémoire dans le cadre de la demande.

Outils similaires

Outil disponible dans d’autres langues