Burrows-Wheeler变换

✍ dations ◷ 2025-05-21 14:50:14 #无损压缩算法,变换

Burrows–Wheeler Transform(简称BWT,也称作块排序压缩),是一个被应用在数据压缩技术(如bzip2)中的算法。该算法于1994年被Michael Burrows(英语:Michael Burrows)和David Wheeler(英语:David Wheeler)在位于加利福尼亚州帕洛阿尔托的DEC系统研究中心(英语:DEC Systems Research Center)发明。它的基础是之前Wheeler在1983年发明的一种没有公开的转换方法。

当一个字符串用该算法转换时,算法只改变这个字符串中字符的顺序而并不改变其字符。如果原字符串有几个出现多次的子串,那么转换过的字符串上就会有一些连续重复的字符,这对压缩是很有用的。该方法能使得基于处理字符串中连续重复字符的技术(如MTF变换和游程编码)的编码更容易被压缩。

举个例子:

该算法的输出因为有更多的重复字符而更容易被压缩了。

算法将输入字符串的所有循环字符串按照字典序排序,并以排序后字符串形成的矩阵的最后一列为其输出。

banana
$ b a n a n a
a $ b a n a n
n a $ b a n a
a n a $ b a n
n a n a $ b a
a n a n a $ b
b a n a n a $
$ b a n a n a
a $ b a n a n
a n a $ b a n
a n a n a $ b
b a n a n a $
n a $ b a n a
n a n a $ b a
a n n b $ a a

Burrows–Wheeler变换的还原过程

  • 基于上述的BWT变换过程,以字符串“banana”为例,我们得到了变换结果“annb$aa”。其还原过程见以下过程:
  1. 1 基于原字符串矩阵的最后一列为“annb$aa”,我们进行该列进行排序,得到“annb$aa”,并将其作为还原矩阵的第一列
Burrows–Wheeler 还原过程 1
输入转移排序组合
- - - - - - a
- - - - - - n
- - - - - - n
- - - - - - b
- - - - - - $
- - - - - - a
- - - - - - a
a - - - - - -
n - - - - - -
n - - - - - -
b - - - - - -
$ - - - - - -
a - - - - - -
a - - - - - -
$ - - - - - -
a - - - - - -
a - - - - - -
a - - - - - -
b - - - - - -
n - - - - - -
n - - - - - -
$ - - - - - a
a - - - - - n
a - - - - - n
a - - - - - b
b - - - - - $
n - - - - - a
n - - - - - a
  1. 2 经过1.1的转移、排序和组合,我们得到了7对邻接字符串:<a$> <na> <na> <ba> <$b> <an> <an>,将这7对邻接字符串进行排序后,得到<$b> <a$> <an> <an> <ba> <na> <na>,由此,我们得到了还原矩阵的第二列“b$nnaaa”
Burrows–Wheeler 还原过程 2
输入转移排序组合
$ - - - - - a
a - - - - - n
a - - - - - n
a - - - - - b
b - - - - - $
n - - - - - a
n - - - - - a
a $ - - - - -
n a - - - - -
n a - - - - -
b a - - - - -
$ b - - - - -
a n - - - - -
a n - - - - -
$ b - - - - -
a $ - - - - -
a n - - - - -
a n - - - - -
b a - - - - -
n a - - - - -
n a - - - - -
$ b - - - - a
a $ - - - - n
a n - - - - n
a n - - - - b
b a - - - - $
n a - - - - a
n a - - - - a
  1. 3 经过1.2的转移、排序和组合,我们得到了7对邻接字符串:<a$b> <na$> <nan> <ban> <$ba> <ana> <ana>,将这7对邻接字符串进行排序后,得到<$ba> <a$b> <ana> <ana> <ban> <na$> <nan>,由此,我们得到了还原矩阵的第三列“abaan$n”
Burrows–Wheeler 还原过程 3
输入转移排序组合
$ b - - - - a
a $ - - - - n
a n - - - - n
a n - - - - b
b a - - - - $
n a - - - - a
n a - - - - a
a $ b - - - -
n a $ - - - -
n a n - - - -
b a n - - - -
$ b a - - - -
a n a - - - -
a n a - - - -
$ b a - - - -
a $ b - - - -
a n a - - - -
a n a - - - -
b a n - - - -
n a $ - - - -
n a n - - - -
$ b a - - - a
a $ b - - - n
a n a - - - n
a n a - - - b
b a n - - - $
n a $ - - - a
n a n - - - a
  1. 4 经过1.3的转移、排序和组合,我们得到了7对邻接字符串:<a$ba> <na$b> <nana> <bana> <$ban> <ana$> <anan>,将这7对邻接字符串进行排序后,得到<$ban> < a$ba > <ana$> < anan > < bana > < na$b > < nana >,由此,我们得到了还原矩阵的第四列“na$naba”
Burrows–Wheeler 还原过程 4
输入转移排序组合
$ b a - - - a
a $ b - - - n
a n a - - - n
a n a - - - b
b a n - - - $
n a $ - - - a
n a n - - - a
a $ b a - - -
n a $ b - - -
n a n a - - -
b a n a - - -
$ b a n - - -
a n a $ - - -
a n a n - - -
$ b a n - - -
a $ b a - - -
a n a $ - - -
a n a n - - -
b a n a - - -
n a $ b - - -
n a n a - - -
$ b a n - - a
a $ b a - - n
a n a $ - - n
a n a n - - b
b a n a - - $
n a $ b - - a
n a n a - - a
  1. 5 经过1.4的转移、排序和组合,我们得到了7对邻接字符串:<a$ban> <na$ba> <nana$> <banan> <$bana> <ana$b> <anana>,将这7对邻接字符串进行排序后,得到<$bana> <a$ban> < ana$b > <anana> <banan> <na$ba> <nana$>,由此,我们得到了还原矩阵的第五列“anbana$”
Burrows–Wheeler 还原过程 5
输入转移排序组合
$ b a n - - a
a $ b a - - n
a n a $ - - n
a n a n - - b
b a n a - - $
n a $ b - - a
n a n a - - a
a $ b a n - -
n a $ b a - -
n a n a $ - -
b a n a n - -
$ b a n a - -
a n a $ b - -
a n a n a - -
$ b a n a - -
a $ b a n - -
a n a $ b - -
a n a n a - -
b a n a n - -
n a $ b a - -
n a n a $ - -
$ b a n a - a
a $ b a n - n
a n a $ b - n
a n a n a - b
b a n a n - $
n a $ b a - a
n a n a $ - a
  1. 6 经过1.5的转移、排序和组合,我们得到了7对邻接字符串:<a$bana> <na$ban> <nana$b> <banaan> <$banan> <ana$ba> <anana$>,将这7对邻接字符串进行排序后,得到<$banan> <a$bana> < ana$ba> <anana$> <banana> <na$ban> <nana$b>,由此,我们得到了还原矩阵的第六列“naa$anb”。
Burrows–Wheeler 还原过程 5
输入转移排序组合
$ b a n a - a
a $ b a n - n
a n a $ b - n
a n a n a - b
b a n a n - $
n a $ b a - a
n a n a $ - a
a $ b a n a -
n a $ b a n -
n a n a $ b -
b a n a n a -
$ b a n a n -
a n a $ b a -
a n a n a $ -
$ b a n a n -
a $ b a n a -
a n a $ b a -
a n a n a $ -
b a n a n a -
n a $ b a n -
n a n a $ b -
$ b a n a n a
a $ b a n a n
a n a $ b a n
a n a n a $ b
b a n a n a $
n a $ b a n a
n a n a $ b a

经过六次排序转移与组合,还原出了原有的字符串即“$banana”。

def bwt(s):    """对字符串进行Burrows-Wheeler变换 不使用唯一字符('EOF')做标记 返回索引值列表"""    #创建所有循环字符串    table =  + s for i in range(len(s))]    #获取排序后的结果    table_sorted = table    table_sorted.sort()    #获取已排序表每个字符串在未排序表中对应字符串的下一个字符串在已排序表中的索引值    indexlist =     for t in table_sorted:        index1 = table.index(t)        index1 = index1+1 if index1 < len(s)-1 else 0        index2 = table_sorted.index(table)        indexlist.append(index2)    #取排序后结果的最后一列作为结果字符串    r = ''.join( for row in table_sorted])    return r, indexlistdef ibwt(r,indexlist):    """对字符串进行反Burrows-Wheeler变换 有索引值的反变换比使用唯一标记的反变换简单很多"""    s=''    x = indexlist    for _ in r:        s = s + r        x = indexlist    return s

python实现(基于末尾添加唯一字符方式)

通过在末尾添加唯一字符(不与输入字串中任何字符相同)后再进行变换,可以不需要传递索引值列表,不过逆变换的时候要做更多计算。

下面的伪代码提供了一个逆过程的朴素实现(输入字符串s为原过程之输出):

相关

  • 来世来世,或作人间天堂,是一个基督教概念,按字面意义解释《启示录》里关于“天国降在人间”、“神与他的子民同在”的描述。来世的概念被认为是一个基督教末世论(最后的未来)用语,因为
  • 半索动物门半索动物门(学名:Hemichordata)是由一类像虫一般,生存于海底的后口动物所组成的门,通常被认为是棘皮动物的旁系群,可追溯至寒武纪早期或晚期,且包括一类已在石炭纪时灭绝的重要化石
  • 威兰海因里希·奥托·威兰(德语:Heinrich Otto Wieland,1877年6月4日-1957年8月5日)是一位德国化学家,终生致力于面对天然产物的有机化学研究,成功分离出多种毒素与生物碱。因对胆汁酸
  • 鲁国鲁国,是周朝的一个姬姓诸侯国,为周成王的四叔周公旦及其子伯禽的封国。鲁国先后传二十五世,三十六位君主,历时八百余年。首都在曲阜,疆域在泰山以南,略有今山东省西南部,国力鼎盛时
  • 被遗忘的国度被遗忘的国度(Forgotten Realms)是TSR公司设计的一个关于著名纸上角色扮演游戏龙与地下城的战役设定。在1980年代是游戏界称之为“金盒子”系列的主轴之一。由游戏设计者艾德
  • VO(NOsub3/sub)sub3/sub三硝酸氧钒(化学式:VO(NO3)3),是+5价钒的硝酸盐。它可由五氧化二氮和五氧化二钒反应得到。它是硝化试剂,可以和苯、苯酚、氯苯、苯甲醚、乙酰苯胺、苯甲酸、苯甲酸乙酯、甲苯等芳
  • 雪蝎蛉科雪蝎蛉科,俗称雪蝎蛉、雪蚤,是长翅目的昆虫。该科仅包含30个物种,全都分布在北半球的极地或高海拔地区。2008年的DNA及蛋白质分析,发现该科的演化支与蚤目的亲缘关系较接近,反而
  • LFA-1淋巴球功能性抗原1(英文:Lymphocyte function-associated antigen 1, LFA-1)是淋巴球上的细胞黏附分子,属于黏附分子中整合素(integrin)超家族。 LFA-1对淋巴球的迁移很重要,能帮助
  • 中兴站 (凤城市)中兴站位于辽宁省凤城市中兴村,为沈丹铁路(乙线)上的一个火车站。建于1943年。距离沈阳站200公里,丹东站77公里,隶属沈阳铁路局管辖。现为四等站。
  • 北畠具房北畠具房(1547年/1551年—1580年1月21日/1603年)是日本战国时代至安土桃山时代的大名。伊势国国司北畠家第9代当主。父亲是第8代当主北畠具教。在天文16年(1547年)出生,家中嫡男。