유니코드 분석기 — 코드포인트·UTF-8·UTF-16 바이트
개발자 도구유니코드 분석기는 입력 문자열을 코드포인트 단위로 분해해 각 문자의 U+ 코드, UTF-8 바이트, UTF-16 유닛, 이름(또는 블록)을 표시하는 개발자 도구입니다.
개념 설명
유니코드는 전 세계 문자에 고유 번호(코드포인트, U+0000~U+10FFFF)를 부여하는 표준이고, UTF-8·UTF-16은 그 번호를 바이트로 저장하는 인코딩입니다. 같은 문자라도 UTF-8은 1~4바이트, UTF-16은 2 또는 4바이트(서로게이트 쌍)로 길이가 달라 문자열 길이 버그의 흔한 원인이 됩니다. 이 도구는 한글 음절과 CJK 한자는 표준 이름을 계산해 보여 주고, 그 외 문자는 소속 블록을 표시합니다. 분석은 전부 브라우저에서 처리됩니다.
UTF-8 길이: U+0000–007F 1바이트 · U+0080–07FF 2바이트 · U+0800–FFFF 3바이트 · U+10000–10FFFF 4바이트(UTF-16 서로게이트 쌍)
사용법
- 1분석할 문자열을 붙여넣습니다(이모지·한글 포함 가능).
- 2분석 버튼을 누릅니다.
- 3문자별 코드포인트, UTF-8·UTF-16 바이트, 이름을 확인하고 복사합니다.
참조표
| 문자 | 코드포인트 | UTF-8 | UTF-16 |
|---|---|---|---|
| A | U+0041 | 41 | 0041 |
| 한 | U+D55C | ED 95 9C | D55C |
| € | U+20AC | E2 82 AC | 20AC |
| 😀 | U+1F600 | F0 9F 98 80 | D83D DE00 |
출처/기준
- The Unicode Standard - Unicode Consortium
- RFC 3629: UTF-8, a transformation format of ISO 10646 - IETF
- MDN Web Docs: Client-side web APIs - MDN Web Docs
자주 묻는 질문
이모지 하나가 length 2로 계산되는 이유는 무엇인가요?
JavaScript 문자열 length는 UTF-16 유닛 수를 세기 때문입니다. U+FFFF를 넘는 이모지는 서로게이트 쌍(유닛 2개)으로 저장되어 length가 2가 됩니다. 이 도구의 UTF-16 열에서 실제 유닛을 확인할 수 있습니다.
모든 문자의 공식 이름이 나오나요?
아니요. ASCII·한글 음절·CJK 한자는 표준 규칙으로 이름을 계산해 보여 주고, 그 외 문자는 소속 유니코드 블록 이름을 표시합니다. 전체 공식 명칭은 유니코드 문자 데이터베이스(UCD)를 참고하세요.
입력한 문자열은 서버로 전송되나요?
아니요. 분석은 브라우저에서 처리되며 입력값을 서버로 보내지 않습니다.