字符集(unicode)和编码(utf-8/gbk)

字符集(unicode)是一张码表,它规定了文字与数字的一一对应关系。与计算机的内部表示没有必然的联系。

字符集:unicode,ascii
编码:UTF-8,UTF-16,GBK
字符集来说要正确编码转码一个字符需要三个关键元素:字库表(character repertoire)、编码字符集(coded character set)、字符编码(character encoding form)

  1. 字库表决定了整个字符集能够展现表示的所有字符的范围
  2. 编码字符集,即用一个编码值code point来表示一个字符字库中位置
  3. 字符编码,将编码字符集和实际存储数值之间的转换关系

unicode就是上文中提到的编码字符集,而UTF-8就是字符编码,即unicode规则字库的一种实现形式.
如果直接存储字符集unicode,过于浪费空间(比如英文前缀基本都是0),这时候引入字符编码utf-8,针对字符集做一层转换优化

UTF-8

每次8个位传输数据
变长编码,根据不同的符号变化字节长度最小编码单位(code unit)为一个字节。一个字节的前1-3个bit为描述性部分,后面为实际序号部分
Unicode的编号从0000开始一直到10FFFF共分为17个Plane
UTF-8则只实现了第一个Plane,范围是\u0000-\uFFFF
使用3byte来表示汉字,使用1byte存储英文

Emoji就是一种在Unicode位于\u1F601-\u1F64F区段的字符,存入UTF-8数据库会报错,原因是超出UTF-8的解析范围。
解决方案1:升级MySQL到5.6或更高版本,并且将表字符集切换至utf8mb4
解决方案2:在入库时做Emoji字符替换成一段特殊的文字编码再入库

GBK

gbk使用双字节编码2byte来表示汉字2byte来表示英文

只有在存储信息中文占比多的时候会使用gbk存储,减少磁盘I/O,数据库cache,以及网络传输时间
为什么国内还有这么多使用 GBK 等编码的人?因为 UTF-8等编码体积比较大占电脑空间比较多,如果面向的使用人群绝大部分都是中国人,用 GBK 等编码也可以。

乱码

编码和解码时用了不同或者不兼容字符集,由于两个字符集的字库表不一样,同一个汉字在两个字符表的位置也不同,最终就会出现乱码

注意解码时一定要指定字符集,否则将会使用默认的字符集进行解码。如果使用了错误的字符集,则会出现乱码。

  1. Java的默认字符集,可以在两个地方设定,一是执行java程序时使用-Dfile.encoding参数指定,例如-Dfile.encoding=UTF-8就指定默认字符集是UTF-8。二是在程序执行时使用Properties进行指定
  2. 默认字符集的优先级如下:
    1.程序执行时使用Properties指定的字符集;
    2.java命令的-Dfile.encoding参数指定的字符集;
    3.操作系统默认的字符集;
    4.JDK中默认的字符集,我跟踪了JDK1.8的源代码,发现其默认字符集指定为ISO-8859-1。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • 字符集和编码简介 在编程中常常可以见到各种字符集和编码,包括ASCII,MBCS,Unicode等字符集。确切的说...
    兰山小亭阅读 8,619评论 0 13
  • 原文在这里:各种字符集和编码详解 在软件的编码和实现中,我们可能会碰到个 一个比较头疼的问题--编码,不同字符间的...
    舌尖上的大胖阅读 1,838评论 0 2
  • 字符是用户可以读写的最小单位。计算机所能支持的字符组成的集合,就叫做字符集。字符集通常以二维表的形式存在。二维表的...
    刘惜有阅读 8,197评论 2 14
  • 曾经在网上看过一段话“旅行的意义,不是逃避,不是艳遇,不是放松心情,更不是炫耀,而是为了洗一洗身体和灵魂,给自...
    ff49b9f02ad8阅读 401评论 0 0
  • 期待已久,最萌的狭义西游记的演绎。我觉得这才是悟空和唐僧师徒关系的打开方式。 当江流儿手掌对着被冰封的大圣的手掌 ...
    贰囍阅读 384评论 0 1