JAVA 및 관련 문자 집합 인코딩 문제에 대한 연구 공유

저자：Eve Cole 업데이트 시간：2025-02-13 18:36:02

다음 기사에서는 "중국어"라는 단어를 예로 들어 설명하고 관련 정보를 검색하면 "중국어"의 GB2312 인코딩이 "d6d0 cec4"이고 유니코드 인코딩이 "4e2d 6587"임을 알 수 있습니다. UTF 인코딩은 "e4b8ad e69687"입니다. ("중국어"라는 두 단어에는 iso8859-1 인코딩이 없지만 iso8859-1 인코딩으로 "표현"될 수 있습니다.)

1. 코딩에 대한 기본 지식:

최초의 인코딩은 ascii 인코딩과 유사한 iso8859-1입니다. 그러나 다양한 언어의 표현을 용이하게 하기 위해 많은 표준 인코딩이 점차 등장했습니다. 중요한 것은 다음과 같습니다.

1. iso8859-1

싱글바이트 인코딩이며, 표현할 수 있는 최대 문자 범위는 0~255이다. 영어 계열에 적용된다. 예를 들어 문자 a의 인코딩은 0x61=97입니다.

당연히 iso8859-1 인코딩으로 표현되는 문자 범위는 매우 좁아서 한자를 표현할 수 없습니다. 그러나 싱글바이트 인코딩이고 컴퓨터의 가장 기본적인 표현 단위와 일치하기 때문에 여전히 iso8859-1 인코딩을 사용하는 경우가 많다. 그리고 많은 프로토콜에서 이 인코딩이 기본적으로 사용됩니다. 예를 들어 iso8859-1 인코딩에는 "중국어"라는 단어가 존재하지 않지만 gb2312 인코딩을 예로 들면 "d6d0 cec4"의 두 문자여야 합니다. iso8859-1 인코딩을 사용하면 4바이트로 분할됩니다. . "d6 d0 ce c4"를 나타냅니다(실제로 저장할 때도 바이트 단위로 처리됩니다). 그리고 UTF 인코딩인 경우 6바이트 "e4 b8 ad e6 96 87"입니다. 분명히 이 표현은 다른 인코딩을 기반으로 해야 합니다.

2.GB2312/GBK

이것은 중국어 문자를 표시하는 데 특별히 사용되는 Hanzi의 국가 표준 코드입니다. 2바이트 인코딩이며 영문자는 iso8859-1(iso8859-1 인코딩과 호환 가능)과 일치합니다. 그 중 gbk 인코딩은 중국어 번체와 간체 문자를 동시에 표시하는 데 사용할 수 있지만 gb2312는 간체 문자만 표시할 수 있습니다. gb2312 인코딩과 호환됩니다.

3.유니코드

이는 모든 언어에서 문자를 표현하는 데 사용할 수 있는 가장 통일된 인코딩이며, 영문자를 포함한 고정 길이 더블바이트(또한 4바이트) 인코딩입니다. 따라서 iso8859-1 인코딩과 호환되지 않으며 어떤 인코딩과도 호환되지 않는다고 말할 수 있습니다. 그러나 iso8859-1 인코딩과 비교할 때 유니오코드 인코딩은 앞에 0바이트만 추가합니다. 예를 들어 문자 a는 "00 61"입니다.

고정 길이 인코딩은 컴퓨터에서 처리하기 쉽고(GB2312/GBK는 고정 길이 인코딩이 아님) 유니코드를 사용하여 모든 문자를 나타낼 수 있으므로 많은 소프트웨어에서 내부적으로 유니코드 인코딩이 사용됩니다. 자바와 같은.

4.UTF

유니코드 인코딩은 iso8859-1 인코딩과 호환되지 않으며 쉽게 더 많은 공간을 차지한다는 점을 고려하면, 영어 문자의 경우 유니코드도 표현하는 데 2바이트가 필요하기 때문입니다. 따라서 유니코드는 전송 및 저장에 편리하지 않습니다. 따라서 UTF 인코딩은 ISO8859-1 인코딩과 호환되며 모든 언어의 문자를 나타내는 데 사용할 수 있습니다. 그러나 UTF 인코딩은 가변 길이 인코딩이며 각 문자의 길이는 1-6입니다. 바이트. 또한 UTF 인코딩에는 간단한 확인 기능이 함께 제공됩니다. 일반적으로 영어는 1바이트로 표현되고, 한자는 3바이트로 표현됩니다.

UTF는 공간을 덜 사용하기 위해 사용되지만 유니코드 인코딩과만 비교됩니다. 이미 중국어 문자라는 것을 알고 있다면 GB2312/GBK를 사용하는 것이 의심할 여지 없이 가장 경제적입니다. 그러나 반면에 UTF 인코딩은 한자에 대해 3바이트를 사용하지만 한자 웹 페이지의 경우에도 웹 페이지에 영어 문자가 많이 포함되어 있기 때문에 UTF 인코딩은 유니코드 인코딩보다 더 많은 비용을 절약한다는 점에 주목할 가치가 있습니다.

2. Java의 문자 처리

Java 애플리케이션을 작성할 때 문자 세트 인코딩과 관련된 부분이 많이 있을 것입니다. 올바른 설정이 필요한 곳도 있고, 어느 정도의 처리가 필요한 곳도 있습니다.

1.getBytes(문자셋)

Java 문자열 처리를 위한 표준 함수로, 문자열이 나타내는 문자를 charset에 따라 인코딩하여 바이트 단위로 표현하는 기능입니다. 문자열은 항상 유니코드 인코딩으로 Java 메모리에 저장됩니다. 예를 들어, "중국어"는 일반적인 상황(즉, 오류가 없는 경우)에서는 "4e2d 6587"로 저장됩니다. 문자 집합이 "gbk"인 경우 "d6d0 cec4"로 인코딩된 다음 바이트 "d6"으로 인코딩됩니다. d0 ce c4"가 반환됩니다. 문자 세트가 "utf8"이면 끝은 "e4 b8 ad e6 96 87"입니다. "iso8859-1"인 경우 인코딩할 수 없기 때문에 최종적으로 "3f 3f"가 반환됩니다. (참고: "3f 3f"는 물음표 2개입니다.)

2. 새로운 문자열(문자셋)

이는 Java 문자열 처리를 위한 또 다른 표준 함수로, 이전 함수와 반대되는 문자 집합 인코딩에 따라 바이트 배열을 결합하고 식별하여 최종적으로 이를 유니코드로 변환하여 저장합니다. 위의 getBytes 예를 참조하면 "gbk"와 "utf8" 모두 "4e2d 6587"이라는 올바른 결과를 생성할 수 있지만 iso8859-1은 최종적으로 "003f 003f"(물음표 2개)가 됩니다.

utf8은 모든 문자를 표현/인코딩하는 데 사용할 수 있으므로 new String( str.getBytes( "utf8" ), "utf8" ) === str은 완전히 되돌릴 수 있습니다.

3. setCharacterEncoding()

이 함수는 http 요청 또는 해당 인코딩을 설정하는 데 사용됩니다.

요청의 경우 제출된 콘텐츠의 인코딩을 참조하며, 지정 후 getParameter()를 통해 올바른 문자열을 직접 얻을 수 있습니다. 지정하지 않으면 기본적으로 iso8859-1 인코딩이 사용되므로 추가 처리가 필요합니다. 아래의 "양식 입력"을 참조하세요. setCharacterEncoding()이 실행되기 전에는 getParameter()를 실행할 수 없다는 점은 주목할 가치가 있습니다. Java 문서에는 다음과 같이 명시되어 있습니다. 요청 매개변수를 읽거나 getReader()를 사용하여 입력을 읽기 전에 이 메소드를 호출해야 합니다.