Recherche Unicode
Déposez un caractère mystérieux, l’espace étrange que votre utilisateur a collé, un glyphe d’un aperçu de police, un emoji qui casse votre regex, et la recherche renvoie son point de code Unicode (U+XXXX) et les octets bruts UTF-8 en hexadécimal, une ligne par caractère.
Comment identifier un caractère Unicode
-
1
Collez le caractère
Vous pouvez coller un glyphe ou une chaîne entière, chaque caractère est analysé dans l'ordre.
-
2
Lisez le point de code
Obtenez la notation canonique U+, en majuscules et complétée par des zéros jusqu'à au moins quatre chiffres hexadécimaux.
-
3
Inspectez les octets UTF-8
Voyez la séquence de 1 à 4 octets que le caractère occupe sur le disque ou sur le réseau.
-
4
Copiez les résultats
La sortie est un tableau au format CSV (caractère, point de code, octets UTF-8) que vous pouvez sélectionner et coller dans un tableur ou un rapport de bug.
Travail d'enquête typique que vous pouvez faire avec une recherche
La plupart des bugs Unicode se ressemblent à l’écran. Le seul moyen de distinguer un espace normal d’un espace insécable, ou une apostrophe courbe d’un prime, est d’inspecter le point de code.
Problèmes courants que la recherche résout
| Semble être | Est en réalité | Point de code |
|---|---|---|
| Espace | Espace insécable | U+00A0 |
| Espace | Espace insécable étroit | U+202F |
| (rien) | Espace de largeur nulle | U+200B |
| (rien) | Liant de largeur nulle | U+200D |
| Apostrophe | Guillemet-apostrophe droit | U+2019 |
| Apostrophe | Prime (pieds/minutes) | U+2032 |
| Tiret | Tiret demi-cadratin | U+2013 |
| Tiret | Trait d’union insécable | U+2011 |
Disposition des octets UTF-8 en un coup d’œil
- 1 octet, ASCII, U+0000 à U+007F (
0xxxxxxx) - 2 octets, Supplément latin, arabe, hébreu (
110xxxxx 10xxxxxx) - 3 octets, CJK, la plupart des symboles (
1110xxxx 10xxxxxx 10xxxxxx) - 4 octets, Emoji, scripts rares (
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)
Si votre colonne de base de données a une longueur d’octets fixe, un emoji de 4 octets occupera quatre emplacements même s’il s’affiche sous la forme d’un seul glyphe, une source courante de bugs de troncature.
Questions fréquentes
Généralement des marqueurs BOM (U+FEFF) au début du fichier ou des liants de largeur nulle parasites laissés par un traitement de texte. Collez-en un dans la recherche et il vous le dira immédiatement, puis vous pourrez les supprimer avec un simple rechercher-remplacer.
Oui. La recherche itère caractère par caractère, donc un mot entier produit une ligne par caractère avec son point de code et ses octets UTF-8.
Un point de code est l’identité abstraite d’un caractère, U+00E9 est toujours “é” peu importe où vous le stockez. UTF-8 est l’un des nombreux encodages qui transforment un point de code en octets ; le même “é” correspond aux deux octets C3 A9 en UTF-8, mais à l’octet unique E9 en Latin-1.
Oui. La recherche est calculée sur notre serveur : les caractères que vous collez sont envoyés, analysés, et leur point de code et leurs octets UTF-8 sont renvoyés immédiatement. Nous ne conservons pas le texte que vous soumettez.
Outils similaires
Générateur de noms de famille aléatoires
Générez un lot de noms de famille aléatoires tirés des noms de famille les plus courants aux États-Unis. Uniquement des noms de famille, sans prénom.
Générateur de noms aléatoires
Générez jusqu'à 50 noms aléatoires en une série à partir de pools équilibrés, courts ou internationaux. Choisissez des noms complets, des prénoms seuls ou un prénom avec initiale.
Traducteur de braille
Traduisez du texte en braille Unicode intégral (grade 1) et décodez le braille en lettres. Gère les majuscules, les chiffres et la ponctuation.
Générateur de noms de villes
Générez des noms fictifs de villes, bourgs, villages et capitales pour le worldbuilding, les cartes, les jeux, les récits et les données factices, avec de courtes notes pour chaque résultat.
Générateur de police Instagram
Générez des "polices" Unicode (gras, italique, script, monospace, fraktur) qui se collent directement dans votre bio, nom, légendes et commentaires Instagram.
Symboles de flèches à copier
Copiez des flèches Unicode courantes en un clic : droites, doubles, diagonales, à crochet, circulaires et triangulaires pour documents, messageries et designs.
Outil disponible dans d’autres langues
- Búsqueda de Unicode [ES]
- Wyszukiwarka Unicode [PL]
- ค้นหา Unicode [TH]
- Unicode検索 [JA]
- Tra cứu Unicode [VI]
- Pesquisa de Unicode [PT]
- Unicode-uppslagning [SV]
- 유니코드 조회 [KO]
- بحث يونيكود [AR]
- Unicode-Suche [DE]
- Pencarian Unicode [ID]
- Unicode opzoeken [NL]
- Unicode Lookup [EN]
- Ricerca Unicode [IT]
- Поиск символов Unicode [RU]
- Unicode Arama [TR]
- Unicode 字符查找 [ZH]