Unicode分析ツール — コードポイント・UTF-8・UTF-16バイト

開発者ツール

Unicode分析ツールは、文字列をコードポイント単位に分解し、各文字のU+コード、UTF-8バイト、UTF-16ユニット、名前(またはブロック)を表示する開発者向けツールです。

AI支援翻訳をレビュー中

このページはAIの支援で翻訳され、まだ専門家によるレビューを完了していません。重要な判断の前に、引用元をご確認ください。

概要

Unicodeはすべての文字に固有の番号(コードポイント、U+0000〜U+10FFFF)を割り当てる規格で、UTF-8とUTF-16はその番号をバイトとして保存するエンコーディングです。同じ文字でもUTF-8では1〜4バイト、UTF-16では2または4バイト(サロゲートペア)と長さが異なり、文字列長のバグのよくある原因になります。このツールはハングル音節とCJK漢字については標準名を計算し、それ以外の文字については所属するUnicodeブロックを表示します。分析はすべてブラウザ内で実行されます。

UTF-8の長さ: U+0000–007F 1バイト · U+0080–07FF 2バイト · U+0800–FFFF 3バイト · U+10000–10FFFF 4バイト(UTF-16サロゲートペア)

使い方

  1. 1分析したい文字列を貼り付けます(絵文字やあらゆる文字体系に対応)。
  2. 2分析ボタンを押します。
  3. 3各文字のコードポイント、UTF-8・UTF-16バイト、名前を確認し、レポートをコピーします。

参照表

Unicode分析ツール — コードポイント・UTF-8・UTF-16バイト 参照表
文字コードポイントUTF-8UTF-16
AU+0041410041
U+D55CED 95 9CD55C
U+20ACE2 82 AC20AC
😀U+1F600F0 9F 98 80D83D DE00

出典・基準

よくある質問

なぜ絵文字1つがJavaScriptで長さ2になるのですか?

文字列のlengthがUTF-16ユニット数を数えるためです。U+FFFFを超える絵文字はサロゲートペア(2ユニット)として保存されるので、lengthは2になります。このツールのUTF-16列で実際のユニットを確認できます。

すべての文字の正式名称が表示されますか?

いいえ。ASCII・ハングル音節・CJK漢字は標準規則で名前をアルゴリズム的に計算して表示し、それ以外の文字は所属するUnicodeブロック名を表示します。完全な正式名称はUnicode Character Database(UCD)を参照してください。

入力した文字列はサーバーに送信されますか?

いいえ。分析はブラウザ内で行われ、入力が送信されることはありません。

関連ツール