유니코드 분석기 — 코드포인트·UTF-8·UTF-16 바이트

개발자 도구

유니코드 분석기는 입력 문자열을 코드포인트 단위로 분해해 각 문자의 U+ 코드, UTF-8 바이트, UTF-16 유닛, 이름(또는 블록)을 표시하는 개발자 도구입니다.

개념 설명

유니코드는 전 세계 문자에 고유 번호(코드포인트, U+0000~U+10FFFF)를 부여하는 표준이고, UTF-8·UTF-16은 그 번호를 바이트로 저장하는 인코딩입니다. 같은 문자라도 UTF-8은 1~4바이트, UTF-16은 2 또는 4바이트(서로게이트 쌍)로 길이가 달라 문자열 길이 버그의 흔한 원인이 됩니다. 이 도구는 한글 음절과 CJK 한자는 표준 이름을 계산해 보여 주고, 그 외 문자는 소속 블록을 표시합니다. 분석은 전부 브라우저에서 처리됩니다.

UTF-8 길이: U+0000–007F 1바이트 · U+0080–07FF 2바이트 · U+0800–FFFF 3바이트 · U+10000–10FFFF 4바이트(UTF-16 서로게이트 쌍)

사용법

  1. 1분석할 문자열을 붙여넣습니다(이모지·한글 포함 가능).
  2. 2분석 버튼을 누릅니다.
  3. 3문자별 코드포인트, UTF-8·UTF-16 바이트, 이름을 확인하고 복사합니다.

참조표

유니코드 분석기 — 코드포인트·UTF-8·UTF-16 바이트 참조표
문자코드포인트UTF-8UTF-16
AU+0041410041
U+D55CED 95 9CD55C
U+20ACE2 82 AC20AC
😀U+1F600F0 9F 98 80D83D DE00

출처/기준

자주 묻는 질문

이모지 하나가 length 2로 계산되는 이유는 무엇인가요?

JavaScript 문자열 length는 UTF-16 유닛 수를 세기 때문입니다. U+FFFF를 넘는 이모지는 서로게이트 쌍(유닛 2개)으로 저장되어 length가 2가 됩니다. 이 도구의 UTF-16 열에서 실제 유닛을 확인할 수 있습니다.

모든 문자의 공식 이름이 나오나요?

아니요. ASCII·한글 음절·CJK 한자는 표준 규칙으로 이름을 계산해 보여 주고, 그 외 문자는 소속 유니코드 블록 이름을 표시합니다. 전체 공식 명칭은 유니코드 문자 데이터베이스(UCD)를 참고하세요.

입력한 문자열은 서버로 전송되나요?

아니요. 분석은 브라우저에서 처리되며 입력값을 서버로 보내지 않습니다.

관련 도구