周围有一些数据结构非常有用,但大多数程序员都不知道。他们是哪一个?

每个人都知道链表、二叉树和散列,但比如Skip列表和Bloom过滤器。我想知道更多不太常见但值得了解的数据结构,因为它们依赖于伟大的想法,丰富了程序员的工具箱。

PS:我还对舞蹈链接等技术感兴趣,这些技术巧妙地利用了通用数据结构的财产。

编辑:请尝试包含更详细描述数据结构的页面链接。此外,试着补充几句关于数据结构为什么很酷的话(正如乔纳斯·Kölker已经指出的那样)。此外,尝试为每个答案提供一个数据结构。这将允许更好的数据结构仅根据其投票结果浮到顶部。


当前回答

霍夫曼树-用于压缩。

其他回答

我认为保罗·费拉吉纳和乔凡尼·曼奇尼的FM指数真的很酷。尤其是在生物信息学方面。它本质上是一个压缩的全文索引,利用了后缀数组和参考文本的burrows-wheeler变换的组合。可以在不解压缩整个索引的情况下搜索索引。

Burrows–Wheeler变换(块排序压缩)

它是压缩的基本算法。假设您想压缩文本文件中的行。你会说,如果你对行进行排序,你就失去了信息。但BWT是这样工作的——它通过对输入进行排序,保持整数索引以恢复原始顺序,从而大大降低了熵。

空间索引,特别是R-树和KD树,有效地存储空间数据。它们适用于地理地图坐标数据和VLSI位置和路线算法,有时也适用于最近邻搜索。

位阵列紧凑地存储单个位,并允许快速位操作。

我认为循环排序是一种非常整洁的排序算法。

这是一种排序算法,用于最小化写入总数。这在处理闪存时尤其有用,因为闪存的寿命与写入量成正比。这是维基百科的文章,但我建议转到第一个链接。(视觉效果不错!)

增强的哈希算法非常有趣。线性哈希很简单,因为它允许一次在哈希表中拆分一个“桶”,而不是重新哈希整个表。这对于分布式缓存特别有用。然而,对于大多数简单的拆分策略,您最终会快速连续地拆分所有存储桶,并且表的负载系数波动非常严重。

我认为螺旋哈希法也很好。与线性哈希一样,一次拆分一个存储桶,存储桶中的记录只有不到一半被放入同一个新存储桶中。它非常干净和快速。然而,如果每个“桶”都由具有类似规格的机器托管,则效率可能很低。为了充分利用硬件,您需要混合使用功能较弱和功能更强的机器。