在HashMap和ConcurrentHashMap的源码中,作者通过:
int index = (tab.length - 1) & hash;
来计算将要插入的元素在数组中的索引位置。这样做有什么妙处呐?
1、保证不会发生数组越界
首先我们要知道,在HashMap和ConcurrentHashMap中,数组的长度按规定一定是2的幂(2的n次方)。
因此,数组的长度的二进制形式是:10000...000, 1后面有偶数个0。
那么,tab.length - 1 的二进制形式就是01111.111, 0后面有偶数个1。最高位是0, 和hash值相“与”,结果值一定不会比数组的长度值大,因此也就不会发生数组越界。
2、保证元素尽可能的均匀分布
由上边的分析可知,tab.length一定是一个偶数,tab.length - 1一定是一个奇数。
假设现在数组的长度(tab.length)为16,减去1后(tab.length - 1)就是15,15对应的二进制是:1111。
现在假设有两个元素需要插入,一个哈希值是8,二进制是1000,一个哈希值是9,二进制是1001。和1111“与”运算后,结果分别是1000和1001,它们被分配在了数组的不同位置,这样,哈希的分布非常均匀。
那么,如果数组长度是奇数呢?减去1后(tab.length - 1)就是偶数了,偶数对应的二进制最低位一定是 0,例如14二进制1110。对上面两个数子分别“与”运算,得到1000和1000。结果都是一样的值。那么,哈希值8和9的元素都被存储在数组同一个index位置的链表中。在操作的时候,链表中的元素越多,效率越低,因为要不停的对链表循环比较。
所以,一定要使哈希均匀分布,尽量减少哈希冲突,提高效率。