Extraire des URL du texte

Collez un journal de discussion, un document markdown, un fil d’e-mails ou un extrait HTML brut et obtenez une liste propre de tous les liens http:// et https:// qu’il contient. L’outil supprime la ponctuation finale, gère la syntaxe des liens markdown et HTML et retire les doublons exacts, pour que vous puissiez envoyer la liste directement à un crawler ou à un outil d’archivage.

Comment extraire des URL

  1. 1

    Collez la source

    Déposez le texte ou le HTML. Les guillemets, les chevrons, la syntaxe de lien markdown et la ponctuation finale sont gérés automatiquement.

  2. 2

    Lancez l'analyse

    Chaque lien `http://` et `https://` est repéré, la ponctuation finale est retirée et les doublons exacts sont éliminés.

  3. 3

    Vérifiez le nombre

    Vous voyez combien d'URL uniques ont été trouvées et la liste complète.

  4. 4

    Copiez ou exportez

    Une URL par ligne, prête pour `curl -I`, un outil d'archivage, un service de captures d'écran ou des listes d'URL de départ pour Screaming Frog.

Qu'est-ce qui compte comme une URL

La détection d’URL est plus difficile qu’il n’y paraît, et cet extracteur s’en tient délibérément à une règle sûre : il ne reconnaît que les liens complets http:// et https://. Tout le reste reste dans votre texte.

Formes reconnues

Forme Exemple
HTTPS absolu https://example.com/path?q=1
HTTP absolu http://example.com
Cible d’un lien Markdown [text](https://example.com)
href absolu en HTML href="https://example.com"

Règles de découpe

La ponctuation finale est retirée, donc (https://example.com). devient https://example.com. Les espaces, guillemets, chevrons, parenthèses, crochets, virgules et points-virgules arrêtent une correspondance. Une URL qui contient des parenthèses est coupée à la première parenthèse ouvrante, un titre à la Wikipedia n’est donc capturé que jusqu’à la parenthèse ouvrante.

Ce qui est ignoré

  • mailto:, tel:, ftp: et tout autre schéma qui n’est pas http ou https.
  • Les liens relatifs au protocole comme //cdn.example.com/asset.js.
  • Les domaines nus et les adresses préfixées www. sans schéma, comme example.com/docs/intro ou www.example.com/page.
  • Les fragments d’ancrage uniquement comme #section et les pseudo-URL JavaScript.

Gestion des doublons

Les doublons exacts sont supprimés : https://example.com ne compte qu’une fois, peu importe le nombre d’apparitions, tandis que Example.com et example.com restent des entrées distinctes. La liste conserve l’ordre de première apparition de chaque URL.

Conseils de post-traitement

  • Mettez en minuscules pour une déduplication canonique. Si Example.com et example.com doivent compter pour un même hôte, passez la sortie en minuscules puis dédupliquez à nouveau.
  • Supprimez les paramètres de suivi avec un nettoyeur UTM avant l’archivage, sinon vous vous retrouverez avec des dizaines de quasi-doublons.
  • Vérifiez le statut. Passez la liste dans un vérificateur de liens brisés pour éliminer les 404 avant de valider la liste.

Questions fréquentes

Seulement si le lien court est écrit avec le schéma complet. bit.ly/xyz seul n’est pas capturé, mais https://bit.ly/xyz est traité comme une URL ordinaire. L’extracteur ne suit pas les redirections ; résolvez-les séparément si vous avez besoin de la destination finale.

Oui, lorsque le href est une URL http:// ou https:// complète. La valeur est extraite proprement sans la balise environnante ; les href relatifs ne sont pas capturés.

Ils sont conservés tels quels. Si vous voulez retirer utm_* et les paramètres de suivi similaires, utilisez un outil de nettoyage d’URL après l’extraction.

Non. Le texte est traité pendant la requête et le contenu n’est ni conservé ni enregistré.

Outils similaires

Outil disponible dans d’autres langues