欢迎光临
我们一直在努力

Java数据结构|map&set(一)

map与set用在搜索相关的场景

搜索树

二叉搜索树又称二叉排序树,它或者是一棵空树,或者是具有以下性质的二叉树:

若它的左子树不为空,则左子树上所有节点的值都小于根节点的值

若它的右子树不为空,则右子树上所有节点的值都大于根节点的值

它的左右子树也分别为二叉搜索树

操作-查找

操作-插入

二叉搜索树中不能插入两个相同的数据

二叉搜索树的时间复杂度:

最好情况:O(logN)

当为一颗完全二叉树时,可以实现

最坏情况:O(N)

操作-删除

替换删除

1.找一个合适的数据,替换cur.val

关于合适的数据选择:

(1)左树找到最大值—-左树的最右边的节点(右数为空)

(2)右树找到最小值—-右树的最左边的节点(左数为空)

2.cur.val=t.val

3.tp.left=t.right

设待删除结点为 cur, 待删除结点的双亲结点为 parent

1. cur.left == null

(1) cur 是 root,则 root = cur.right

(2) cur 不是 root,cur 是 parent.left,则 parent.left = cur.right

(3) cur 不是 root,cur 是 parent.right,则 parent.right = cur.right

2. cur.right == null

(1)cur 是 root,则 root = cur.left

(2) cur 不是 root,cur 是 parent.left,则 parent.left = cur.left 

(3) cur 不是 root,cur 是 parent.right,则 parent.right = cur.left

3. cur.left != null && cur.right != null

(1) 需要使用替换法进行删除,即在它的右子树中寻找中序下的第一个结点(关键码最小),用它的值填补到被 删除节点中,再来处理该结点的删除问题

性能分析

插入和删除操作都必须先查找,查找效率代表了二叉搜索树中各个操作的性能。

对有n个结点的二叉搜索树,若每个元素查找的概率相等,则二叉搜索树平均查找长度是结点在二叉搜索树的深度 的函数,即结点越深,则比较次数越多。

但对于同一个关键码集合,如果各关键码插入的次序不同,可能得到不同结构的二叉搜索树:

最优情况下,二叉搜索树为完全二叉树,其平均比较次数为:logN

最差情况下,二叉搜索树退化为单支树,其平均比较次数为:N/2

问题:如果退化成单支树,二叉搜索树的性能就失去了。那能否进行改进,不论按照什么次序插入关键码,都可以是二叉搜索树的性能最佳?

AVL数和红黑树

和 java 类集的关系

TreeMap 和 TreeSet 即 java 中利用搜索树实现的 Map 和 Set;实际上用的是红黑树,而红黑树是一棵近似平衡的 二叉搜索树,即在二叉搜索树的基础之上 + 颜色以及红黑树性质验证

搜索

Map和set是一种专门用来进行搜索的容器或者数据结构,其搜索的效率与其具体的实例化子类有关。

模型

一般把搜索的数据称为关键字(Key),和关键字对应的称为值(Value),将其称之为Key-value的键值对,所以 模型会有两种:

1. 纯 key 模型,比如:

有一个英文词典,快速查找一个单词是否在词典中

快速查找某个名字在不在通讯录中

2. Key-Value 模型,比如:

统计文件中每个单词出现的次数,统计结果是每个单词都有与其对应的次数:<单词,单词出现的次数>

梁山好汉的江湖绰号:每个好汉都有自己的江湖绰号

而Map中存储的就是key-value的键值对,Set中只存储了Key。

Map 的使用

Map是一个接口类,该类没有继承自Collection,该类中存储的是结构的键值对,并且K一定是唯一的,不能重复。

关于Map.Entry的说明

Map.Entry 是Map内部实现的用来存放键值对映射关系的内部类,该内部类中主要提供了 的获取,value的设置以及Key的比较方式

方法                                                                                                                 解释

K getKey()                                                                                         返回 entry 中的 key

V getValue()                                                                                      返回 entry 中的 value

V setValue(V value)                                                                  将键值对中的value替换为指定value

注意:Map.Entry并没有提供设置Key的方法

Map 的常用方法说明

其中最为特殊的是Set> entrySet(),相当于把二叉搜索树中的每一个节点放入到一个集合中,然后通过遍历set来获得每个节点的值

注意:

1. Map是一个接口,不能直接实例化对象,如果要实例化对象只能实例化其实现类TreeMap或者HashMap

2. Map中存放键值对的Key是唯一的,value是可以重复的

3. 在TreeMap中插入键值对时,key不能为空,否则就会抛NullPointerException异常,value可以为空。但 是HashMap的key和value都可以为空。

4. Map中的Key可以全部分离出来,存储到Set中来进行访问(因为Key不能重复)。

5. Map中的value可以全部分离出来,存储在Collection的任何一个子集合中(value可能有重复)。

6. Map中键值对的Key不能直接修改,value可以修改,如果要修改key,只能先将该key删除掉,然后再来进行 重新插入。

7. TreeMap和HashMap的区别

自定类型放入集合当中去时,一旦涉及到了有关比较,一定要实现cpmpare接口

因为没实现Ieterable接口

Set 的说明

Set与Map主要的不同有两点:Set是继承自Collection的接口类,Set中只存储了Key。

常见方法说明

方法                                                                                         解释

boolean add(E e)                                         添加元素,但重复元素不会被添加成功

void clear()                                                                         清空集合

boolean contains(Object o)                                         判断 o 是否在集合中

Iterator iterator()                                                                 返回迭代器

boolean remove(Object o)                                             删除集合中的 o

int size()                                                                      返回set中元素的个数

boolean isEmpty()                                 检测set是否为空,空返回true,否则返回false

Object[] toArray()                                         将set中的元素转换为数组返回

boolean containsAll(Collection c) 集合c中的元素是否在set中全部存在,是返回true,否则返回 false

boolean addAll(Collection c)                 将集合c中的元素添加到set中,可以达到去重的效果

注意:

1. Set是继承自Collection的一个接口类

2. Set中只存储了key,并且要求key一定要唯一

3. TreeSet的底层是使用Map来实现的,其使用key与Object的一个默认对象作为键值对插入到Map中的

4. Set最大的功能就是对集合中的元素进行去重

5. 实现Set接口的常用类有TreeSet和HashSet,还有一个LinkedHashSet,LinkedHashSet是在HashSet的基础 上维护了一个双向链表来记录元素的插入次序。

6. Set中的Key不能修改,如果要修改,先将原来的删除掉,然后再重新插入

7. TreeSet中不能插入null的key,HashSet可以。

8. TreeSet和HashSet的区别

哈希表

顺序结构以及平衡树中,元素关键码与其存储位置之间没有对应的关系,因此在查找一个元素时,必须要经过关键 码的多次比较。顺序查找时间复杂度为O(N),平衡树中为树的高度,即O(logN ),搜索的效率取决于搜索过程中 元素的比较次数。

理想的搜索方法:可以不经过任何比较,一次直接从表中得到要搜索的元素。 如果构造一种存储结构,通过某种函 数(hashFunc)使元素的存储位置与它的关键码之间能够建立一一映射的关系,那么在查找时通过该函数可以很快 找到该元素。

哈希函数设置为:hash(key) = key % capacity; capacity为存储元素底层空间总的大小。

例如:数据集合{1,7,6,4,5,9};

冲突-概念

对于两个数据元素的关键字 和 (i != j),有 != ,但有:Hash( ) == Hash( ),即:不同关键字通过相同哈 希哈数计算出相同的哈希地址,该种现象称为哈希冲突或哈希碰撞

把具有不同关键码而具有相同哈希地址的数据元素称为“同义词”

冲突-避免

首先,我们需要明确一点,由于我们哈希表底层数组的容量往往是小于实际要存储的关键字的数量的,这就导致一 个问题,冲突的发生是必然的,但我们能做的应该是尽量的降低冲突率

冲突-避免-哈希函数设计

引起哈希冲突的一个原因可能是:哈希函数设计不够合理。 哈希函数设计原则:

哈希函数的定义域必须包括需要存储的全部关键码,而如果散列表允许有m个地址时,其值域必须在0到m-1 之间

哈希函数计算出来的地址能均匀分布在整个空间中

哈希函数应该比较简单

常见哈希函数

1. 直接定制法–(常用)

取关键字的某个线性函数为散列地址:Hash(Key)= A*Key + B 优点:简单、均匀 缺点:需要事先知道关 键字的分布情况 使用场景:适合查找比较小且连续的情况 

2. 除留余数法–(常用)

设散列表中允许的地址数为m,取一个不大于m,但最接近或者等于m的质数p作为除数,按照哈希函数: Hash(key) = key% p(p<=m),将关键码转换成哈希地址

注意:哈希函数设计的越精妙,产生哈希冲突的可能性就越低,但是无法避免哈希冲突

冲突-避免-负载因子调节

散列表的载荷因子定义为:a=填入表中的元素个数/散列表的长度

负载因子越大,冲突率越高

当逼近负载因子或者等于负载因子,此时要赶快进行扩容

冲突-解决-闭散列

闭散列:也叫开放定址法,当发生哈希冲突时,如果哈希表未被装满,说明在哈希表中必然还有空位置,那么可以 把key存放到冲突位置中的“下一个” 空位置中去。

1. 线性探测

线性探测:从发生冲突的位置开始,依次向后探测,直到寻找到下一个空位置为止。

线性探测容易将冲突的元素聚集在一起

2. 二次探测

找下一个空位置的方法为: Hi= (H0 +i^2 )% m

总结:比散列最大的缺陷就是空间利用率比较低,这也是哈希的缺陷。

冲突-解决-开散列/哈希桶

开散列法又叫链地址法(开链法),首先对关键码集合用散列函数计算散列地址,具有相同地址的关键码归于同一子 集合,每一个子集合称为一个桶,各个桶中的元素通过一个单链表链接起来,各链表的头结点存储在哈希表中。

1. 每个桶的背后是另一个哈希表

2. 每个桶的背后是一棵搜索树

Java中的HashMap也是采用数组加链表的形式,但是比较特殊,链表在特定情况下会变成红黑树(当这个数组长度超过64&&链表的长度超过了8),同时链表的长度是一个常数

性能分析

虽然哈希表一直在和冲突做斗争,但在实际使用过程中,我们认为哈希表的冲突率是不高的,冲突个数是可控的, 也就是每个桶中的链表的长度是一个常数,所以,通常意义下,我们认为哈希表的插入/删除/查找时间复杂度是 O(1) 。

赞(0)
未经允许不得转载:171主机测评 » Java数据结构|map&set(一)
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址