Extracteur de n-grammes
Un n-gramme est une suite de n mots consécutifs dans un texte. Cet extracteur passe votre texte en minuscules, le découpe en mots à chaque espace et à chaque signe de ponctuation, puis compte tous les n-grammes de la longueur que vous choisissez (de 1 à 8). Le résultat est un tableau de fréquences au format CSV, trié du plus fréquent au plus rare : exactement le tableau sur lequel reposent les contrôles de densité de mots-clés en SEO, le lissage des modèles de langue et la détection de plagiat.
Comment extraire des n-grammes
-
1
Collez votre texte
Déposez un article, une transcription ou une fiche produit. Aucune limite de longueur pour une entrée raisonnable.
-
2
Choisissez n
Unigrammes (1), bigrammes (2), trigrammes (3), jusqu'à 8. Une seule longueur par exécution.
-
3
Lancez l'extraction
Le texte est passé en minuscules puis découpé en mots ; la ponctuation sert de séparateur et disparaît.
-
4
Lisez le tableau de fréquences
Chaque n-gramme apparaît avec son nombre d'occurrences, du plus fréquent au moins fréquent.
-
5
Copiez le CSV
La sortie est séparée par des virgules (N-gram,Count), prête à coller dans un tableur.
Ce que chaque longueur de n-gramme vous apprend
| N | Nom | Cas d’utilisation |
|---|---|---|
| 1 | Unigramme | Densité de mots-clés, cartographie des sujets |
| 2 | Bigramme | Expressions (“search intent”, “page speed”), collocations |
| 3 | Trigramme | Expressions de longue traîne, détection de caractéristiques |
| 4+ | Quadrigramme et au-delà | Détection de contenu dupliqué, alertes de plagiat |
Comment l’outil découpe votre texte
- Tout est mis en minuscules, si bien que “The” et “the” se retrouvent sur la même ligne.
- Un mot est toute suite ininterrompue de lettres, de chiffres ou d’apostrophes. Tout autre caractère (ponctuation, symboles, sauts de ligne) fait office de séparateur et disparaît.
- Les limites de phrase ne sont pas conservées. Le dernier mot d’une phrase et le premier mot de la suivante peuvent malgré tout former un n-gramme : méfiez-vous des paires à cheval sur deux phrases. Si cela compte, analysez phrase par phrase ou paragraphe par paragraphe.
- Les mots vides sont conservés. Rien n’est filtré à votre place : supprimez ces lignes du CSV après coup si vous ne voulez que des expressions porteuses de sens.
- Les mots sont repérés grâce aux espaces et à la ponctuation. Le français sépare ses mots par des espaces, l’outil fonctionne donc directement. Attention toutefois : l’apostrophe fait partie du mot, si bien que “l’article” est compté comme un seul mot, distinct de “article”. Le chinois, le japonais et le thaï, eux, n’insèrent aucune espace entre les mots : une phrase entière arrive comme un mot unique et doit d’abord être segmentée (jieba, MeCab, un segmenteur de thaï).
Quand supprimer les mots vides
Les mots vides sont des mots fonctionnels très fréquents : “the”, “a”, “of”, “and” en anglais, “le”, “de”, “et”, “à” en français. Les laisser gonfle la liste des bigrammes de scories du type “of the” ou “de la”. Cet extracteur les conserve : supprimez donc ces lignes de l’export lorsque vous cherchez des expressions porteuses de sens, et gardez-les lorsque vous étudiez le style, l’attribution d’auteur ou des modèles de langue où les mots fonctionnels portent justement le signal.
Cas d’utilisation en SEO
Pour un article ciblant “nginx config generator”, vérifiez :
- Que votre bigramme et votre trigramme cibles figurent dans le top 20. Si “nginx config” est au rang 40, vous employez probablement le terme trop rarement.
- Que vous ne bourrez pas de mots-clés. S’il occupe la première place avec une avance énorme, le texte se lit comme du spam.
- Que des voisins sémantiques sont présents. Des bigrammes connexes comme “server block”, “proxy pass” et “ssl certificate” confirment aux moteurs de recherche que le sujet est réellement traité.
Utilisation en TAL et dans la recherche
- Les modèles de langue utilisent les fréquences de n-grammes pour le lissage et le repli (Kneser-Ney, Good-Turing).
- Les études d’attribution d’auteur comparent les distributions de trigrammes entre les auteurs candidats.
- L’évaluation de la traduction automatique (BLEU) note le recouvrement des n-grammes entre la traduction produite et la traduction de référence.
Questions fréquentes
De un tweet (où les n-grammes n’ont quasiment aucun sens) à un chapitre de livre. Pour une fiabilité statistique sur les bigrammes, comptez plus de 1 000 mots ; pour les trigrammes, plus de 10 000. En dessous, les classements sont trop bruités.
Pas ici. Le texte est toujours passé en minuscules avant le comptage, si bien que “The” et “the” (comme “Apple” et “apple”) partagent une seule ligne au lieu de se scinder en deux. Il n’existe pas de mode sensible à la casse : si vous devez distinguer des noms propres ou du code, marquez-les dans le texte avant de le coller.
Ils servent de séparateurs de mots et n’apparaissent jamais à l’intérieur d’un n-gramme. En revanche, ils ne coupent pas la fenêtre de comptage : le dernier mot d’une phrase et le premier mot de la suivante sont toujours comptés ensemble comme un bigramme. Si les limites de phrase sont essentielles, traitez les phrases ou les paragraphes séparément.
Uniquement si vous segmentez le texte au préalable. Les mots sont détectés comme des suites de lettres et de chiffres entre séparateurs, or ces langues s’écrivent sans espace entre les mots : une phrase entière arrive donc comme un mot unique. Faites-la passer par un segmenteur (jieba, MeCab, un segmenteur de thaï) pour que les mots soient séparés par des espaces, puis collez le résultat ici. Le français et les autres langues à espaces fonctionnent sans préparation.
L’outil n’en applique aucune : le filtrage se fait après l’export. La liste anglaise la plus courante est l’ensemble de 179 mots de NLTK, utilisé par la plupart des outils SEO. Snowball, SpaCy et scikit-learn proposent des listes légèrement différentes. Pour le français, servez-vous de la liste de mots vides française de NLTK ou de spaCy.
Outils similaires
Générateur de noms de villes
Générez des noms fictifs de villes, bourgs, villages et capitales pour le worldbuilding, les cartes, les jeux, les récits et les données factices, avec de courtes notes pour chaque résultat.
Symbole inférieur ou égal
Copiez le signe ≤ et les symboles de comparaison mathématique associés. Inclut Unicode, entités HTML et balisage LaTeX pour les tableurs, articles et pages web.
Symboles de flèches à copier
Copiez des flèches Unicode courantes en un clic : droites, doubles, diagonales, à crochet, circulaires et triangulaires pour documents, messageries et designs.
Générateur de noms aléatoires
Générez jusqu'à 50 noms aléatoires en une série à partir de pools équilibrés, courts ou internationaux. Choisissez des noms complets, des prénoms seuls ou un prénom avec initiale.
Convertisseur de texte adapté à la dyslexie
Reformatez le texte collé en paragraphes courts et en lignes d'environ 72 caractères pour une lecture plus facile. Copiez le résultat dans n'importe quel document, e-mail ou éditeur.
Résolveur d'anagrammes
Saisissez jusqu'à 10 lettres et voyez chaque arrangement unique, avec les permutations en double supprimées et la liste limitée à 200 résultats.
Outil disponible dans d’autres langues
- N-gram 抽出ツール [JA]
- Trình trích xuất N-gram [VI]
- N-그램 추출기 [KO]
- مستخرج N-gram [AR]
- Extrator de n-gramas [PT]
- N-Gramm-Extraktor [DE]
- Extractor de n-gramas [ES]
- N-gram-extractor [NL]
- N-gram-extraktor [SV]
- Ekstraktor N-gram [ID]
- เครื่องมือแยก N-gram [TH]
- Ekstraktor n-gramów [PL]
- N-gram Extractor [EN]
- Estrattore di n-grammi [IT]
- Экстрактор N-грамм [RU]
- N-gram Çıkarıcı [TR]
- N-gram 提取器 [ZH]