区位码国标码机内码转换问题(精品)-FreeNAS中文网

admin 管理员组

文章数量: 887021

2024年1月24日发(作者：kerastase masque rehydratant)

区位码国标码机内码转换问题（精品）

国标码并不等于区位码，它是由区位码稍作转换得到,其转换方法为:先将十进制区码和位码转换为十六进制的区码和位码，;这样就得了一个与国标码有一个相对位置差的代码，;再将这个代码的第一个字节和第二个字节分别加上20H，就得到国标码。如:“保” 字的国标码为3123H，它是经过下面的转换得到的:1703D,>1103H->+20H,>3123H。

输入码、区位码、国标码与机内码国家标准局1980年颁布的《信息交换用汉字编码字符集"基本集》(代号为GB2312 80)规定的汉字交换码作为国家标准汉字编码。 GB2312 80中共有7445个字符符号: 汉字符号6763个一级汉字3755个(按汉语拼音字母顺序排列) 二级汉字3008个(按部首笔划顺序排列) 非汉字符号682个 GB2312 80规定，我们知道，键盘是当前微机的主要输入设备，;输入码就是使用英文键盘输入汉字时的编码。目前，我国已推出的输入码有数百种，但用户使用较多的约为十几种，按输入码编码的主要依据，大体可分为顺序码、音码、形码、音形码四类，如“保” 字，用全拼，输入码为码为“BAO”，用区位码，输入码为“1703”，用五笔字型则为“WKS”。

计算机只识别由0、1组成的代码，ASCII码是英文信息处理的标准编码，汉字信息处理也必须有一个统一的标准编码。汉字交换码(国标码)主要用于汉字信息交换，我国国家标准局于1981年5月颁布了《信息交换用汉字编码字符集——基本集》，代号为GB2312-80，共对6763个汉字和682个图形字符进行了编码，其编码原则为:汉字用两个字节表示，每个字节用七位码(高位为0)，;所有的国标码汉字及符号组成一个94行94列的二维代码表中。在此方阵中，每一行称为一个"区"，每一列称为一个"位"。这个方阵实际上组成一个有94个区(编号由01到94)，每个区有94个位(编号由01到94)的汉字字符集。每两个字节分别用两位十

进制编码，前字节的编码称为区码，后字节的编码称为位码，此即区位码，其中，高两位为区号，低两位为位号。这样区位码可以唯一地确定某一汉字或字符;反之，任何一个汉字或符号都对应一个唯一的区位码，没有重码。如“保”字在二维代码表中处于17区第3位，区位码即为“1703 ”。国标码并不等于区位码，它是由区位码稍作转换得到,其转换方法为:先将十进制区码和位码转换为十六进制的区码和位码，;这样就得了一个与国标码有一个相对位置差的代码，;再将这个代码的第一个字节和第二个字节分别加上20H，就得到国标码。如:“保” 字的国标码为3123H，它是经过下面的转换得到的:1703D,>1103H->+20H,>3123H。

国标码是汉字信息交换的标准编码，但因其前后字节的最高位为0，与ASCII码发生冲突，如“保” 字，国标码为31H和23H，而西文字符“1”和“#”的SCII也为31H和23H，现假如内存中有两个字节为31H和23H，;这到底是一个汉字，还是两个西文字符“1”;和“#”?于是就出现了二义性，显然，国标码是不可能在计算机内部直接采用的，于是，;汉字的机内码采用变形国标码，其变换方法为:将国标码的每个字节都加上128，即将两个字节的最高位由0改1，其余7位不变，如:由上面我们知道，“保”字的国标码为3123H，前字节为00110001B，后字节为00100011B，高位改1为10110001B和10100011B 即为B1A3H，因此，

字的机内码就是B1A3H;。

显然，汉字机内码的每个字节都大于128，这就解决了与西文字符的ASCII码冲突的问题。如上所述，汉字输入码、区位码、;国标码与机内码都是汉字的编码形式，它们之间有着千丝万缕的联系，但其间的区别也是不容忽视的

汉字的国标码=汉字的区位码十进制转换为十六进制，再加上2020H。汉字的机内码=汉字的国标码(十六进制)+8080H

区位码(十进制->十六进制)+2020H=国标码+8080H=机内码

还有区位码+A0A0=机内码

将十进制区码和位码转换为十六进制的区码和位码

这个代码的第一个字节和第二个字节分别加上20H，就得到国标码。

如:已知汉字的"大"的区位码是2083,区位码是10进制的，而国标码和机内码是16进制的，首先要把2083转化成16进制。

就是把20除16取余得到14 如同10进制转化2进制

同样把83除16取余

最后把得到的数加2020是国标码再加上8080是机内码

简单的方法:

先将区位码的高位和低位，变成16进制。

加 2020H 就是国标码;再加 8080H 就是机内码。

从区位码到机内码，也就是直接加A0A0H，就可以了。

如某汉字的区位码是5448，54化成16进制是36，48化成16进制是30 合起来是3630H，加A0A0H，结果是D6D0H，所以其机内码是D6D0。

我们知道，键盘是当前微机的主要输入设备，输入码就是使用英文键盘输入汉字时的编码。目前，我国已推出的输入码有数百种，但用户使用较多的约为十几种，按输入码编码的主要依据，大体可分为顺序码、音码、形码、音形码四类，如"保"字，用全拼，输入码为码为"BAO"，用区位码，输入码为"1703"，用五笔字型则为"WKS"。

计算机只识别由0、1组成的代码，ASCII码是英文信息处理的标准编码，汉字信息处理也必须有一个统一的标准编码。我国国家标准局于1981年5月颁布了《信息交换用汉字编码字符集??基本集》，代号为GB2312-80，共对6763个汉字和682个图形字符进行了编码，其编码原则为:汉字用两个字节表示，每个字节用七位码(高位为0)，国家标准将汉字和图形符号排列在一个94行94列的二维代码表中，每两个字节分别用两位十进制编码，前字节的编码称为区码，后字节的编码

称为位码，此即区位码，如"保"字在二维代码表中处于17区第3位，区位码即为"1703

"。

国标码并不等于区位码，它是由区位码稍作转换得到，其转换方法为:先将十进制区码和位码转换为十六进制的区码和位码，这样就得了一个与国标码有一个相对位置差的代码，再将这个代码的第一个字节和第二个字节分别加上20H，就得到国标码，相当于如果不转换的话，在两个字节上分别加上32即可。如:"保"字的国标码为3123,，它是经过下面的转换得到的:1703D,>1103H->+20H,>3123H。

国标码是汉字信息交换的标准编码，但因其前后字节的最高位为0，与ASCII码发生冲突，如"保"字，国标码为31H和23H，而西文字符"1"和"#"的SCII也为31H和23H，现假如内存中有两个字节为31H和23H，这到底是一个汉字，还是两个西文字符"1"和"#",于是就出现了二义性，显然，国标码是不可能在计算机内部直接采用的，于是，汉字的机内码采用变形国标码，其变换方法为:将国标码的每个字节都加上128，即将两个字节的最高位由0改1，其余7位不变，也就是如果国标码是16进制的，直接加上8080H即可。如:由上面我们知道，"保"字的国标码为3123H，前字节为00110001B，后字节为00100011B，高位改1为10110001B和10100011B

即为B1A3H，因此，"保"字的机内码就是B1A3H。

显然，汉字机内码的每个字节都大于128，这就解决了与西文字符的ASCII码冲突的问题。

如上所述，汉字输入码、区位码、国标码与机内码都是汉字的编码形式，它们之间有着千丝万缕的联系，但其间的区别也是不容忽视的。

公式总结:

国标码区位码， 2020H ,

国标码， 8080H , 机内码

为了适应计算机处理汉字信息的需要，1981年我国颁布了GB2312国家标准。该标准选出6763个常用汉字(其中，一级常用汉字3755个，二级汉字3008个)和682个非汉字字符，并为每个字符规定了标准代码，以便在不同的计算机系统之间进行汉字文本交换。

GB2312字符集构成一个94行、94列的二维表，行号称为区号，列号称为位号，每一个汉字或符号在码表中的位置用它所在的区号和位号来表示。

为了处理与存储的方便，每个汉字的区号和位号在计算机内部分别用一个字节来表示。例如，“学”字的区号为49，位号为07，它的区位码即为4907，用2个字节的二进制数表示为:

00110001 00000111

区位码无法用于汉字通信，因为它可能与通信使用的控制码(00H~1FH)(即0~31)发生冲突。ISO2022规定每个汉字的区号和位号必须分别加上32(即二进制数00100000)，经过

这样的处理而得的代码称为国标交换码，简称交换码，因此，“学”字的国标交换码计算为:

00110001 00000111

+00100000 +00100000

-------------------

01010001 00100111

用十六进制数表示即为5127H。

由于文本中通常混合使用汉字和西文字符，汉字信息如果不予以特别标识，就会与单字节的ASCII码混淆。此问题的解决方法之一是将一个汉字看成是两个扩展

ASCII码，使表示GB2312汉字的两个字节的最高位都为1。这种高位为1的双字节汉字编码即为GB2312汉字的机内码，简称为内码。

因此，“学”字的机内码为:

11010001 10100111

用16进制表示即为D1A7H。

最后要指出的是，汉字的输入编码与汉字的机内码是不同范畴的概念。不管采用什么样的编码输入法(例如拼音、五笔字型等)来输入一个汉字，其机内码都是相同的。

说明:本文整理自《大学计算机信息技术教程》(南京大学出版社)一书。

-----------------------------------------------------------------

汉字库通俗地说就是计算机软件系统中的汉字仓库，依据不同的标准，字库中汉字的数量是不同的，以前的主要标准有:

1、GB 2312 汉字编码字符集

从1975年开始，我国为了研究汉字的使用频度，进行了大规模的字频统计工作，内容包括工业、农业、军事、科技、政治、经济、文学、艺术、教育、体育、医药卫生、天文地理、自然、化学、文字改革、考古等多方面的出版物，在数以亿计的浩瀚文献资料中，统计出实际使用的不同的汉字数为6335个，而其中有3000多个汉字的累计使用频度达到了99.9%，而另外的3000多个累计频度不到0.1%，说明了常用汉字与次常用汉字的数量不足7000个，这就为国家制定汉字库标准提供了依据。1980年颁布了《信息交换用汉字编码字符集—基本集》的

国标交换码，国家标准号为:GB2312-80，选入了6763个汉字，分为两级，一级字库中有3755个，是常用汉字，二级字库中有3008个，是次常用汉字;还选入了682个字符，包含有数字、一般符号、拉丁字母、***假名、希腊字母、俄文字母、拼音符号、注音字母等。以前我国大陆的各种中文DOS版本、Windows3.1

/3.2版本，装入的字库都是国标一二级字库。遇到“镕、啰、瞭、袆、祎、曌、赟、贇、鱻、驫、犇……”等汉字，既无法输入，又不能打印。后来国家技术监督局又颁布了一个与之相对应的繁体字集，全称《信息交换用汉字编码字符集辅助集》，标准号为GB/T12345-90。

-----------------------------------------------------------------

GB2312编码大约包含6000多汉字(不包括特殊字符)，编码范围为第一位b0-f7，第二位编码范围为a1-fe(第一位为cf时，第二位为a1-d3)，计算一下汉字个数为6762个汉字。当然还有其他的字符。包括控制键和其他字符大约7573个字符编码。

GBK编码是对GB2312编码的扩充，容纳的汉字更多，但仅仅是扩充，没有质的变化。保留了所有G B2312编码，在此基础上进行编码范围的扩充.容纳(包含特殊字符)共22014个字符编码。

GB18030编码是在gbk编码基础上的扩充，因为汉字更多，仅仅使用两位编码已经不能容纳要求的汉字，所以采用了24位混和的办法，可以支持更多的汉字编码。并且保留了原有的GBK 2字节编码兼容GB2312和GBK编码的文件。大概容纳55657个编码(包含特殊字符)。

unicode编码(也就是UTF编码):俗称万国码，致力于使用统一的编码准则表达各国的文字。为表达更多的文字，utf-8采用2/3混编的方式。目前容纳的汉字范围小于gbk编码。并且以3字节的方式处理中文，带来了兼容性的问题，原有的GBK，GB2312，GB18030编码文件都不能正常的处理，还有很长的路要走。

本文标签：编码字节国标码

版权声明：本文标题：区位码国标码机内码转换问题(精品) 内容由网友自发贡献，该文观点仅代表作者本人，转载请联系作者并注明出处：http://www.freenas.com.cn/jishu/1706072722h500713.html，本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，一经查实，本站将立刻删除。

技术交流 – FreeNAS中文网

区位码国标码机内码转换问题(精品)

更多相关文章

html5文档的基本格式

url参数格式处理

pythonurlencode编码

jdbc url参数

urlencoder编码

正则表达式入门教程

dts音效解码编码概念剖析

国产乱码一二三2020三区别

java 字符串 utf-8编码原理

java中文乱码字符集

python的encode函数

hive encode函数

pgsql encode用法

本地远程我都行Plex影音平台攻略

U盘无法格式化，变成8M，RAW格式，0字节的U盘修复教程

windows无法格式化u盘_如何解决u盘0字节无法格式化的问题

修复录音笔或其它录音设备损坏的WAVMP3录音文件或0kb字节文件

U盘文件夹损坏0字节：现象解析、恢复方法与预防措施

怎样Linux下修复U盘驱动器_liunx系统u盘坏了怎么办，2024年最新字节跳动技术总监自爆

U盘容量变0字节：故障解析与数据拯救指南

发表评论

推荐文章

【ChatGPT】入门指南

税来了！价涨了？海淘咋整？！

phpcms down.php 漏洞,phpcms v9.6.1任意文件下载漏洞分析及EXP

Android微信内h5页面唤起浏览器打开页面的技术分析和实现

【杂谈】Windows 系统安装介质制作及系统安装

热门文章

VS错误代码以及解决方案

植物大战僵尸各种僵尸攻略（四）

springboot的定时任务

Android 天气APP（八）城市切换 之 自定义弹窗与使用

病毒式营销简介

基于CentOS 7.x搭建Open***服务器与配置详解

Windows系统漏洞学习总结

Windows驱动—64位驱动测试&amp;64位驱动测试签名

怎么清理ug10注册表_实用 | 小白该如何清理电脑、让电脑没这么卡？

Win10开始菜单点击没有反应打不开怎么办？

最新文章

Raid技术

LSI_阵列卡操作手册

破解Centos7_root用户密码

Redhat重置Root用户密码方法

远程批量修改linux服务器密码的脚本

Windows7 系统安全设置权限技巧

（Windows系统）详细介绍Windows系统 含有英文版

最新Windows 11教育版下载：专为教育设计的系统！

Win7系统下搭建NFS服务器

零基础使用UltraISO制作并安装纯净Win10系统指南

Android 天气APP（八）城市切换之自定义弹窗与使用

Windows驱动—64位驱动测试&64位驱动测试签名

（Windows系统）详细介绍Windows系统含有英文版