Recherche Unicode

Déposez un caractère mystérieux, l’espace étrange que votre utilisateur a collé, un glyphe d’un aperçu de police, un emoji qui casse votre regex, et la recherche renvoie son point de code Unicode (U+XXXX) et les octets bruts UTF-8 en hexadécimal, une ligne par caractère.

Comment identifier un caractère Unicode

  1. 1

    Collez le caractère

    Vous pouvez coller un glyphe ou une chaîne entière, chaque caractère est analysé dans l'ordre.

  2. 2

    Lisez le point de code

    Obtenez la notation canonique U+, en majuscules et complétée par des zéros jusqu'à au moins quatre chiffres hexadécimaux.

  3. 3

    Inspectez les octets UTF-8

    Voyez la séquence de 1 à 4 octets que le caractère occupe sur le disque ou sur le réseau.

  4. 4

    Copiez les résultats

    La sortie est un tableau au format CSV (caractère, point de code, octets UTF-8) que vous pouvez sélectionner et coller dans un tableur ou un rapport de bug.

Travail d'enquête typique que vous pouvez faire avec une recherche

La plupart des bugs Unicode se ressemblent à l’écran. Le seul moyen de distinguer un espace normal d’un espace insécable, ou une apostrophe courbe d’un prime, est d’inspecter le point de code.

Problèmes courants que la recherche résout

Semble être Est en réalité Point de code
Espace Espace insécable U+00A0
Espace Espace insécable étroit U+202F
(rien) Espace de largeur nulle U+200B
(rien) Liant de largeur nulle U+200D
Apostrophe Guillemet-apostrophe droit U+2019
Apostrophe Prime (pieds/minutes) U+2032
Tiret Tiret demi-cadratin U+2013
Tiret Trait d’union insécable U+2011

Disposition des octets UTF-8 en un coup d’œil

  • 1 octet, ASCII, U+0000 à U+007F (0xxxxxxx)
  • 2 octets, Supplément latin, arabe, hébreu (110xxxxx 10xxxxxx)
  • 3 octets, CJK, la plupart des symboles (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 octets, Emoji, scripts rares (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Si votre colonne de base de données a une longueur d’octets fixe, un emoji de 4 octets occupera quatre emplacements même s’il s’affiche sous la forme d’un seul glyphe, une source courante de bugs de troncature.

Questions fréquentes

Généralement des marqueurs BOM (U+FEFF) au début du fichier ou des liants de largeur nulle parasites laissés par un traitement de texte. Collez-en un dans la recherche et il vous le dira immédiatement, puis vous pourrez les supprimer avec un simple rechercher-remplacer.

Oui. La recherche itère caractère par caractère, donc un mot entier produit une ligne par caractère avec son point de code et ses octets UTF-8.

Un point de code est l’identité abstraite d’un caractère, U+00E9 est toujours “é” peu importe où vous le stockez. UTF-8 est l’un des nombreux encodages qui transforment un point de code en octets ; le même “é” correspond aux deux octets C3 A9 en UTF-8, mais à l’octet unique E9 en Latin-1.

Oui. La recherche est calculée sur notre serveur : les caractères que vous collez sont envoyés, analysés, et leur point de code et leurs octets UTF-8 sont renvoyés immédiatement. Nous ne conservons pas le texte que vous soumettez.

Outils similaires

Outil disponible dans d’autres langues