Extraire des URL du texte
Collez un journal de discussion, un document markdown, un fil d’e-mails ou un extrait HTML brut et obtenez une liste propre de tous les liens http:// et https:// qu’il contient. L’outil supprime la ponctuation finale, gère la syntaxe des liens markdown et HTML et retire les doublons exacts, pour que vous puissiez envoyer la liste directement à un crawler ou à un outil d’archivage.
Comment extraire des URL
-
1
Collez la source
Déposez le texte ou le HTML. Les guillemets, les chevrons, la syntaxe de lien markdown et la ponctuation finale sont gérés automatiquement.
-
2
Lancez l'analyse
Chaque lien `http://` et `https://` est repéré, la ponctuation finale est retirée et les doublons exacts sont éliminés.
-
3
Vérifiez le nombre
Vous voyez combien d'URL uniques ont été trouvées et la liste complète.
-
4
Copiez ou exportez
Une URL par ligne, prête pour `curl -I`, un outil d'archivage, un service de captures d'écran ou des listes d'URL de départ pour Screaming Frog.
Qu'est-ce qui compte comme une URL
La détection d’URL est plus difficile qu’il n’y paraît, et cet extracteur s’en tient délibérément à une règle sûre : il ne reconnaît que les liens complets http:// et https://. Tout le reste reste dans votre texte.
Formes reconnues
| Forme | Exemple |
|---|---|
| HTTPS absolu | https://example.com/path?q=1 |
| HTTP absolu | http://example.com |
| Cible d’un lien Markdown | [text](https://example.com) |
| href absolu en HTML | href="https://example.com" |
Règles de découpe
La ponctuation finale est retirée, donc (https://example.com). devient https://example.com. Les espaces, guillemets, chevrons, parenthèses, crochets, virgules et points-virgules arrêtent une correspondance. Une URL qui contient des parenthèses est coupée à la première parenthèse ouvrante, un titre à la Wikipedia n’est donc capturé que jusqu’à la parenthèse ouvrante.
Ce qui est ignoré
mailto:,tel:,ftp:et tout autre schéma qui n’est pashttpouhttps.- Les liens relatifs au protocole comme
//cdn.example.com/asset.js. - Les domaines nus et les adresses préfixées
www.sans schéma, commeexample.com/docs/introouwww.example.com/page. - Les fragments d’ancrage uniquement comme
#sectionet les pseudo-URL JavaScript.
Gestion des doublons
Les doublons exacts sont supprimés : https://example.com ne compte qu’une fois, peu importe le nombre d’apparitions, tandis que Example.com et example.com restent des entrées distinctes. La liste conserve l’ordre de première apparition de chaque URL.
Conseils de post-traitement
- Mettez en minuscules pour une déduplication canonique. Si
Example.cometexample.comdoivent compter pour un même hôte, passez la sortie en minuscules puis dédupliquez à nouveau. - Supprimez les paramètres de suivi avec un nettoyeur UTM avant l’archivage, sinon vous vous retrouverez avec des dizaines de quasi-doublons.
- Vérifiez le statut. Passez la liste dans un vérificateur de liens brisés pour éliminer les 404 avant de valider la liste.
Questions fréquentes
Seulement si le lien court est écrit avec le schéma complet. bit.ly/xyz seul n’est pas capturé, mais https://bit.ly/xyz est traité comme une URL ordinaire. L’extracteur ne suit pas les redirections ; résolvez-les séparément si vous avez besoin de la destination finale.
Oui, lorsque le href est une URL http:// ou https:// complète. La valeur est extraite proprement sans la balise environnante ; les href relatifs ne sont pas capturés.
Ils sont conservés tels quels. Si vous voulez retirer utm_* et les paramètres de suivi similaires, utilisez un outil de nettoyage d’URL après l’extraction.
Non. Le texte est traité pendant la requête et le contenu n’est ni conservé ni enregistré.
Outils similaires
Compteur de mots
Comptez les mots, caractères, phrases et paragraphes avec le temps de lecture, le temps de parole, la densité des mots-clés et un indice de lisibilité Flesch pour les essais, publications, légendes et meta descriptions.
Générateur de noms de villes
Générez des noms fictifs de villes, bourgs, villages et capitales pour le worldbuilding, les cartes, les jeux, les récits et les données factices, avec de courtes notes pour chaque résultat.
Symboles de flèches à copier
Copiez des flèches Unicode courantes en un clic : droites, doubles, diagonales, à crochet, circulaires et triangulaires pour documents, messageries et designs.
Générateur de texte stylé
Transformez du texte simple en six styles Unicode : cercle, largeur complète, monospace, script, fraktur et double trait, pour bios, légendes et noms d’utilisateur.
Symbole inférieur ou égal
Copiez le signe ≤ et les symboles de comparaison mathématique associés. Inclut Unicode, entités HTML et balisage LaTeX pour les tableurs, articles et pages web.
Résolveur d'anagrammes
Saisissez jusqu'à 10 lettres et voyez chaque arrangement unique, avec les permutations en double supprimées et la liste limitée à 200 résultats.
Outil disponible dans d’autres langues
- Metinden URL'leri Çıkarma [TR]
- Extrahera URL:er från text [SV]
- Extrair URLs do Texto [PT]
- Extract URLs from Text [EN]
- استخراج عناوين URL من النص [AR]
- 텍스트에서 URL을 추출합니다 [KO]
- テキストからURL抽出 [JA]
- URL's extraheren uit tekst [NL]
- ดึง URL จากข้อความ [TH]
- 从文本中提取 URL [ZH]
- Extraer URLs del Texto [ES]
- Ekstrak URL dari Teks [ID]
- Wydobywanie URL-ów z tekstu [PL]
- Trích xuất URL từ văn bản [VI]
- URLs aus Text extrahieren [DE]
- Извлечение URL из текста [RU]
- Estrai URL dal testo [IT]