Unicode分析ツール — コードポイント・UTF-8・UTF-16バイト
開発者ツールUnicode分析ツールは、文字列をコードポイント単位に分解し、各文字のU+コード、UTF-8バイト、UTF-16ユニット、名前(またはブロック)を表示する開発者向けツールです。
AI支援翻訳をレビュー中
このページはAIの支援で翻訳され、まだ専門家によるレビューを完了していません。重要な判断の前に、引用元をご確認ください。
概要
Unicodeはすべての文字に固有の番号(コードポイント、U+0000〜U+10FFFF)を割り当てる規格で、UTF-8とUTF-16はその番号をバイトとして保存するエンコーディングです。同じ文字でもUTF-8では1〜4バイト、UTF-16では2または4バイト(サロゲートペア)と長さが異なり、文字列長のバグのよくある原因になります。このツールはハングル音節とCJK漢字については標準名を計算し、それ以外の文字については所属するUnicodeブロックを表示します。分析はすべてブラウザ内で実行されます。
UTF-8の長さ: U+0000–007F 1バイト · U+0080–07FF 2バイト · U+0800–FFFF 3バイト · U+10000–10FFFF 4バイト(UTF-16サロゲートペア)
使い方
- 1分析したい文字列を貼り付けます(絵文字やあらゆる文字体系に対応)。
- 2分析ボタンを押します。
- 3各文字のコードポイント、UTF-8・UTF-16バイト、名前を確認し、レポートをコピーします。
参照表
| 文字 | コードポイント | UTF-8 | UTF-16 |
|---|---|---|---|
| A | U+0041 | 41 | 0041 |
| 한 | U+D55C | ED 95 9C | D55C |
| € | U+20AC | E2 82 AC | 20AC |
| 😀 | U+1F600 | F0 9F 98 80 | D83D DE00 |
出典・基準
- The Unicode Standard - Unicode Consortium
- RFC 3629: UTF-8, a transformation format of ISO 10646 - IETF
- MDN Web Docs: Client-side web APIs - MDN Web Docs
よくある質問
なぜ絵文字1つがJavaScriptで長さ2になるのですか?
文字列のlengthがUTF-16ユニット数を数えるためです。U+FFFFを超える絵文字はサロゲートペア(2ユニット)として保存されるので、lengthは2になります。このツールのUTF-16列で実際のユニットを確認できます。
すべての文字の正式名称が表示されますか?
いいえ。ASCII・ハングル音節・CJK漢字は標準規則で名前をアルゴリズム的に計算して表示し、それ以外の文字は所属するUnicodeブロック名を表示します。完全な正式名称はUnicode Character Database(UCD)を参照してください。
入力した文字列はサーバーに送信されますか?
いいえ。分析はブラウザ内で行われ、入力が送信されることはありません。