在工做中少不了碰到文件乱码的问题,面对这么多的中文汉字编码,真不知该选哪一个好,不如完全搞清楚,让乱码灰飞烟灭;如下介绍文本编码中经常使用到的几种:iso8859-一、GDK/GB23十二、ANSI、unicode 以及UTF ;程序员
iso8859-1 一般叫作Latin-1,属于单字节编码,最多能表示的字符范围是0-255,应用于英文系列。好比,字母a的编码为0x61=97。 很明显,iso8859-1编码表示的字符范围很窄,没法表示中文字符。可是,因为是单字节编码,和计算机最基础的表示单位一致,因此不少时候,仍旧使用iso8859-1编码来表示。并且在不少协议上,默认使用该编码。好比,虽然"中文"两个字不存在iso8859-1编码,以gb2312编码为例,应该是"d6d0 cec4"两个字符,使用iso8859-1编码的时候则将它拆开为4个字节来表示:"d6 d0 ce c4"(事实上,在进行存储的时候,也是以字节为单位处理的)。windows
GB2312是汉字的国标码,是简体中文的字符集编码;专门用来表示汉字,是双字节编码,而英文字母和iso8859-1一致(兼容iso8859-1编码)。
苹果OS以GB2312为基本汉字编码;
GBK 是 GB2312的扩展,除了兼容GB2312外,它还能显示繁体中文,还有日文的假名;
Windows 95/98以GBK为基本汉字编码、但兼容支持GB2312。网络
不一样的国家和地区制定了不一样的标准,由此产生了 GB2312, BIG5, JIS 等各自的编码标准。这些使用 2 个字节来表明一个字符的各类汉字延伸编码方式,称为 ANSI 编码。在简体中文操做系统下,ANSI 编码表明 GB2312 编码,在日文操做系统下,ANSI 编码表明 JIS 编码。(BIG5:台湾标准)
不一样 ANSI 编码之间互不兼容,当信息在国际间交流时,没法将属于两种语言的文字,存储在同一段 ANSI 编码的文本中。
ANSI编码表示英文字符时用一个字节,表示中文用两个字节,而unicode无论表示英文字符仍是中文都是用两个字节来表示。编码
Unicode(统一码、万国码、单一码、标准万国码)是业界的一种标准,它可使电脑得以呈现世界上数十种文字的系统。spa
大概来讲,Unicode 编码系统可分为编码方式和实现方式两个层次。
Unicode 的编码方式与 ISO 10646 的通用字符集(Universal Character Set,UCS)概念相对应,目前实际应用的 Unicode 版本对应于 UCS-2,使用16位的编码空间。也就是每一个字符占用2个字节。这样理论上一共最多能够表示 2 即 65536 个字符。基本知足各类语言的使用。实际上目前版本的 Unicode 还没有填充满这16位编码,保留了大量空间做为特殊使用或未来扩展。操作系统
Unicode 的实现方式不一样于编码方式。一个字符的 Unicode 编码是肯定的。可是在实际传输过程当中,因为不一样系统平台的设计不必定一致,以及出于节省空间的目的,对 Unicode 编码的实现方式有所不一样。Unicode 的实现方式称为Unicode转换格式(Unicode Translation Format,简称为 UTF)。
目前通用的实现方式是 UTF-16小尾序(BOM)、UTF-16大尾序(BOM)和 UTF-8。在微软公司Windows XP操做系统附带的记事本中,“另存为”对话框能够选择的四种编码方式除去非 Unicode 编码的 ANSI 外,其他三种“Unicode”、“Unicode big endian”和“UTF-8”即分别对应这三种实现方式。.net
注:一般咱们看到的编码选项中,和UTF-8放在一块的“Unicode编码”指的是UTF-16 小端编码;设计
UTF-8是UNICODE的一种变长字符编码,由Ken Thompson于1992年建立。
UTF-8, 8bit编码, ASCII不做变换, 其余字符作变长编码, 每一个字符1-3 byte(英文字母用一个字节,汉字使用3个字节),有如下优势:code
UTF8 和 UTF16 都是变长表示的,欧美程序员会以为太浪费,由于欧美字符 0x0000 - 0x00FF 就搞定了,UTF8 最小变长是 1 个字节,而 UTF16 变长是 2 个字节,
utf-8 与 uft-16 表示 'a' a的ascii是0X61
utf-8为[0X61]
uft-16 [0x00,0X61]orm
注意,虽说utf-8是为了使用更少的空间而使用的,但那只是相对于utf-16编码来讲,若是已经知道是汉字,则使用GB2312/GBK无疑是最节省的。
windows系统下将文件用记事本打开,而后文件--另存为 在对话框最下面的编码那一栏就有文件对应的编码。
代码开发常常用到source insight,这个软件的注释是支持ANSI的代码编写、可是若是是UTF-8的中文(在Linux下默认的生成文件,编码都是UTF-8编码的),在source insight下显示的就是乱码文件;
解决的方法详见附录参考文章;
1.关于编码ansi、GB23十二、unicode与utf-8的区别
http://blog.csdn.net/chruan/article/details/8812110
2.source insight中文注释乱码问题的解决方案
http://blog.csdn.net/ccf19881030/article/details/8987759
3.Source Insight完美转换UTF-8 到 GB2312
http://blog.csdn.net/e0sys1/article/details/4670188
4.UNICODE wiki
http://www.baike.com/wiki/Unicode
Posted by: 大CC | 31JUL,2014
博客:blog.me115.com [订阅]
微博:新浪微博