String相关笔记

  • 常用初始化方法
String str1 = "abc";
String str2 = new String(new char[]{'\u4f60', '\u597d'}); // 你好
  • String底层存储是什么数据结构以及字符集

JDK8以及之前都是char[],jdk9改成了byte[],官方文档:http://openjdk.java.net/jeps/254

char在java里占两个字节,语言内置的编码也就是 UTF-16,UTF-16编码,大部分常见字符都是2个字节,char直接能表示,对于人预期的length更友好,但是ASCII里的本身一个字节就可以表示的字符也浪费了一半内存。

Unicode是字符集,规定了字符和二进制位的对应关系,字符编码是具体怎么编码,方便传输和存储。比如GBK UTF-8 UTF-16就是编码规则

  • String.length()返回的是什么长度

字符串底层存储是char[],所以长度就是这个数组的长度。而不是“字符串长度”,jdk9后修改成byte[]数组后也不会修改对外api输出结果。是兼容的,依然和原来一样。只是节约内存

// 𠮷 = \ud842\udfb7
String str1 = new String(new char[]{'\ud842', '\udfb1', '\u4f60', '\u597d'}); // 𠮷你好
String str2 = new String(new char[]{'\udfb7', '\ud842', '\u4f60', '\u597d'}); // ??你好

第一个字符串从人的角度理解长度是3,实际这个字符串length是4。因为UTF-16编码规则问题,2个字节的和unicode码保持一致,超过2个字节的比如这个“𠮷”就属于4个字节的,他会拆成2个2字节部分,一个叫高位,一个叫低位,但是程序怎么知道这两个部分是一个字符而不是独立的字符呢。这个是因为UTF-16本身编码就规定了高位和低位的开头bit固定的

因为unicode目前最大的范围也就是到0x10 FFFF,超过2个字节的区间也就是0x1 0000 ~0x10 FFFF,这个区间正好也就是F FFFF个字符,也就是20bit,能表示2^20(100多万)个字符,UTF-16就把这20个bit拆成高低各10位,然后一共占用4个字节,多出来了12位,高低位分别规定前6个固定的标识方便区分,就从unicode的表里选了一段区间,这个区间不能规定任何字符,不然高位和人家单个字节的有重叠,鬼才知道怎么区分,这个区间就是高位D800,加上10个bit能表示的数字个数3FFF,也就成为了unicode上经典的区间:D800~DBFF (https://unicode-table.com/cn/#high-surrogates),自然再加1顺着排的就是低位的标识区间,DC00~DFFF(https://unicode-table.com/cn/#low-surrogates)

  • String Literals(字符串常量,也就是双引号直接括起来的)

String str = "hello world";

String.intern方法上注释写的:All literal strings and string-valued constant expressions are interned,参看java语言规范里定义的:https://docs.oracle.com/javase/specs/jls/se12/html/jls-3.html#jls-3.10.5

意思其实就是:字符串常量、或者编译期能确定的字符串拼接的常量,默认会intern,也就是实例都是同一个
也就是那个str1==str2类的问题基本都是很容易能判断出来的

  • Sting immutable(不可变对象)

String类是final的,也不提供对外的修改的api,就是没有入口可以修改字符串内容
好处: 线程安全,也方便缓存,坏处,字符串拼接都是不停地返回新的字符串,还是有一定的额外开销

类似的还有什么值传递或者引用传递的概念。其实真要说本质一切都是“值”,基本类型存的就是实际内容,引用类型存的就是地址,由于字符串不可变。就算字符串作为参数传递给其他方法,也不用担心会被修改内容,类似的还有基本类型的各种包装类型,还有基本类型本身,在方法传递过程中。不用担心会被意外的修改。很放心

  • length() indexOf() substring()这些方法其实有时候都是有bug的

由于UTF-16编码问题,java还采用的一个char2个字节,总会有一部分超过BMP范围的字符会拆分成两个高低代理对,分开存到char里,但是这些方法直接操作的还是char[],所以大多数时候是返回的符合预期的,小部分特殊字符。会有问题

  • 一些常见的跟字符串有关的算法问题

回文串
最长不重复子串
...

总结

String不可变
hashcode会缓存
底层存储目前jdk8还是用的char,内置字符编码是UTF-16
字符串常量都会默认intern
值传递,引用传递这种概念就别纠结,String怎么传都改不了原字符串的
小心内置编码和java字符串抽象带来的坑,length,indexOf等等
如果面试的话。稍微看看一些简单的算法问题

©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 218,204评论 6 506
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 93,091评论 3 395
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 164,548评论 0 354
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,657评论 1 293
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,689评论 6 392
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,554评论 1 305
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,302评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,216评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,661评论 1 314
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,851评论 3 336
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,977评论 1 348
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,697评论 5 347
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,306评论 3 330
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,898评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,019评论 1 270
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,138评论 3 370
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,927评论 2 355

推荐阅读更多精彩内容