`
ThinkInMyLife
  • 浏览: 47725 次
  • 性别: Icon_minigender_1
  • 来自: 杭州
社区版块
存档分类
最新评论

字符串匹配那些事[转]

阅读更多

[转自:http://www.yybean.com/,版权归http://www.yybean.com/所有]

 

本文主要介绍KMP算法和BM算法,它们分别是前缀匹配和后缀匹配的经典算法。所谓前缀匹配是指:模式串和母串的比较从左到右,模式串的移动也是从左到右;所谓后缀匹配是指:模式串和母串的的比较从右到左,模式串的移动从左到右。看得出来前缀匹配和后缀匹配的区别就仅仅在于比较的顺序不同。下文分别从最简单的前缀蛮力匹配算法和后缀蛮力匹配算法入手,详细的介绍KMP算法和BM算法以及它们的实现。

KMP算法

首先来看一下前缀蛮力匹配算法的代码(以下代码从linux源码string.h中抠出),模式串和母串的比较是从左到右进行(strncmp()),如果找不到和模式串相同的子串,则从左到右移动模式串,距离为1(s++)。

char * strstr(register const char *s, register const char *wanted)
{
    register const size_t len = strlen(wanted);
    if (len == 0) return (char *)s;
    while (*s != *wanted || strncmp(s, wanted, len))
        if (*s++ == '\0')
            return (char *)NULL;
    return (char *)s;
}

KMP算法中的KMP分别是指三个人名:Knuth、Morris、Pratt,其本质也是前缀匹配算法,对比前缀蛮力匹配算法,区别在于它会动态调整每次模式串的移动距离,而不仅仅是加一,从而加快匹配过程。下图通过一个直观的例子展示前缀蛮力匹配算法和KMP算法的区别,前文提过,这二者唯一的不同在于模式串移动距离。

上图中,前缀蛮力匹配算法发现匹配不上,就向右移动距离1,而KMP算法根据已经比较过的前缀信息,了解到应该移动距离为2;换句话说针对母串的下一个匹配字符,KMP算法了解它下回应该匹配模式串的哪个位置,比如上图中,针对母串的第i+1个字符,KMP算法了解它应该匹配模式串的第k+1个字符。为什么会是这样,这是因为母串的子串T[i-k, i]=aba,而模式串的子串P[0,k]=aba,这二者正好相等。所以模式串应该移动到这个位置,从而让母串的第i+1个字符和模式串的第k+1个字符继续比较。

那k值又是如何寻找?请注意上图中,模式串位置j已经匹配上母串的位置i,也就是T[i-k, i] = P[j-k, j]=aba;根据前文的T[i-k, i] = P[0, k] = aba, 从而得出P[0, k] = P[j-k, j] = aba。通过观察发现,就是在模式的子串[0, j]中寻找一个最长前缀[0,k],从而使得[j-k, j] = [0,k];
于是可以定义一个jump数组,jump[j]=k,表示满足P[0, k] ==P[j-k, j] 的最大k值,或者表述为:如果模式串j+1匹配不上母串的i+1,那跳转到模式串k+1继续比较。有了这个jump数组,就很容易写出kmp算法的伪代码:

j:=0;
for i:=1 to n do
Begin
   while (j>0) and (P[j+1]<>T[i]) do j:=jump[j];[
   if P[j+1]=T[i] then j:=j+1;
   if j=m then
   Begin
       writeln('Pattern occurs with shift ',i-m);
   end;
end;

KMP算法中jump数组的构建可以通过归纳法来解决,首先确定jump[1]=0;假设jump[j]=k,也就是P[0, k] == P[j-k, k],如果P[j+1] == P[k+1],那么得出[0,k+1] = P[j-k, j+1],从而更加定义得出jump[j+1] = k+1;
如果P[j+1] != P[k+1],那就接着比较P[j+1] ?= P[k1+1],其中(jump[k] = k1),根据(jump[k]=k1)的定义,P[0,k1] == P[k-k1, k],根据(jump[j]=k)的定义,P[0, k] == P[j-k, k],根据这两个等式,推出P[0, k1] == P[j-k1, j],如果此时P[j+1] == P[k1+1],则得出:jump[j+1] = K1 +1 = jump[k] +1。
如果P[j+1] != P[K1+1],继续递归比较P[j+1] 和P[jump[jump[k]]+1]  ….  P[1];
如果依次比较都不相等,那么jump[j+1] = 0;写成伪代码如下,可以看出其实就是模式串自我匹配的过程。

jump[1]:=0;
j:=0;
for i:=2 to m do
begin
    while (j>0) and (P[j+1]<>P[i]) do j:=jump[j];
    if P[j+1]=P[i] then  j:=j+1;
    jump[i]:=j;
end;

考虑模式串匹配不上母串的最坏情况,前缀蛮力匹配算法的时间复杂度最差是O(n×m),最好是O(n),其中n为母串的长度,m为模式串的长度。KMP算法最差的时间复杂度是O(n);最好的时间复杂度是O(n/m)。

BM算法

后缀匹配,是指模式串的比较从右到左,模式串的移动也是从左到右的匹配过程,经典的BM算法其实是对后缀蛮力匹配算法的改进。所以还是先从最简单的后缀蛮力匹配算法开始。下面直接给出伪代码,注意这一行代码:j++;BM算法所做的唯一的事情就是改进了这行代码,即模式串不是每次移动一步,而是根据已经匹配的后缀信息,从而移动更多的距离。

j = 0;
while (j <= strlen(T) - strlen(P)) {
   for (i = strlen(P) - 1; i >= 0 && P[i] ==T[i + j]; --i)
   if (i < 0)
      match;
   else
      ++j;
}

为了实现更快移动模式串,BM算法定义了两个规则,好后缀规则和坏字符规则,如下图可以清晰的看出他们的含义。利用好后缀和坏字符可以大大加快模式串的移动距离,不是简单的++j,而是j+=max (shift(好后缀), shift(坏字符))

先来看如何根据坏字符来移动模式串,shift(坏字符)分为两种情况:

  • 坏字符没出现在模式串中,这时可以把模式串移动到坏字符的下一个字符,继续比较,如下图:

  • 坏字符出现在模式串中,这时可以把模式串第一个出现的坏字符和母串的坏字符对齐,当然,这样可能造成模式串倒退移动,如下图:


为了用代码来描述上述的两种情况,设计一个数组bmBc['k'],表示坏字符‘k’在模式串中出现的位置距离模式串末尾的最大长度,那么当遇到坏字符的时候,模式串可以移动距离为: shift(坏字符) = bmBc[T[i]]-(m-1-i)。如下图:

数组bmBc的创建非常简单,直接贴出代码如下:

void preBmBc(char *x, int m, int bmBc[]) {
    int i;
    for (i = 0; i &lt; ASIZE; ++i)
         bmBc[i] = m;
    for (i = 0; i &lt; m - 1; ++i)
         bmBc[x[i]] = m - i - 1;
}

再来看如何根据好后缀规则移动模式串,shift(好后缀)分为三种情况:

    • 模式串中有子串匹配上好后缀,此时移动模式串,让该子串和好后缀对齐即可,如果超过一个子串匹配上好后缀,则选择最靠左边的子串对齐。

    • 模式串中没有子串匹配上后后缀,此时需要寻找模式串的一个最长前缀,并让该前缀等于好后缀的后缀,寻找到该前缀后,让该前缀和好后缀对齐即可。

    • 模式串中没有子串匹配上后后缀,并且在模式串中找不到最长前缀,让该前缀等于好后缀的后缀。此时,直接移动模式到好后缀的下一个字符。

为了实现好后缀规则,需要定义一个数组suffix[],其中suffix[i] = s 表示以i为边界,与模式串后缀匹配的最大长度,如下图所示,用公式可以描述:满足P[i-s, i] == P[m-s, m]的最大长度s。

构建suffix数组的代码如下:

suffix[m-1]=m;
for (i=m-2;i>=0;--i){
    q=i;
    while(q>=0&&P[q]==P[m-1-i+q])
        --q;
    suffix[i]=i-q;
}

有了suffix数组,就可以定义bmGs[]数组,bmGs[i] 表示遇到好后缀时,模式串应该移动的距离,其中i表示好后缀前面一个字符的位置(也就是坏字符的位置),构建bmGs数组分为三种情况,分别对应上述的移动模式串的三种情况

    • 模式串中有子串匹配上好后缀

    • 模式串中没有子串匹配上好后缀,但找到一个最大前缀

    • 模式串中没有子串匹配上好后缀,但找不到一个最大前缀

构建bmGs数组的代码如下:

void preBmGs(char *x, int m, int bmGs[]) {
   int i, j, suff[XSIZE];
   suffixes(x, m, suff);
   for (i = 0; i < m; ++i)
      bmGs[i] = m;
   j = 0;
   for (i = m - 1; i >= 0; --i)
      if (suff[i] == i + 1)
         for (; j < m - 1 - i; ++j)
            if (bmGs[j] == m)
               bmGs[j] = m - 1 - i;
   for (i = 0; i <= m - 2; ++i)
      bmGs[m - 1 - suff[i]] = m - 1 - i;
}

再来重写一遍BM算法:

j = 0;
while (j <= strlen(T) - strlen(P)) {
   for (i = strlen(P) - 1; i >= 0 && P[i] ==T[i + j]; --i)
   if (i < 0)
      match;
   else
      j += max(bmGs[i], bmBc[T[i]]-(m-1-i));
}

考虑模式串匹配不上母串的最坏情况,后缀蛮力匹配算法的时间复杂度最差是O(n×m),最好是O(n),其中n为母串的长度,m为模式串的长度。BM算法时间复杂度最好是O(n/(m+1)),最差是多少?留给读者思考。

分享到:
评论

相关推荐

    C++数据结构字符串及KMP匹配算法

    C++模板实现的数据结构字符串类,实现了字符串的拼接、删除、截取、转换、匹配、替换等常用功能,其中匹配算法使用了基于KMP的快速匹配算法。程序具有良好的编码风格和详细的算法注释。

    python中字符串比较使用is、==和cmp()总结

    例如,确定一个字符串是否和另外一个字符串匹配。正确的,你可以使用 is equal 或 == 操作符。你也可以使用例如 &gt;= 或 &lt; 来确定几个字符串的排列顺序。 从官方文档上看 The operators ``is`` and ``is not`` ...

    LevenshteinTrie:允许模糊字符串匹配的 Trie 数据结构

    允许模糊字符串匹配的 Trie 数据结构 这是 Steve Hanov 在他的编写的 Python 程序的 Go 版本 这已经完成了,但没有测试。 ###这个怎么运作 这是一个基本的 。 您可以搜索作为字符串后缀的所有单词。 您还可以...

    查找匹配字符串search

    在“找到”时,还要求显示出匹配字符串在句子中的位置,在“找到”时BX寄存器的内容为匹配字符串的首地址,将此值减到句子的首地址,再将差值加1 即是所要的匹配字符串在句子中的位置,可将位置转换为十六进制数从...

    Delphi开发技巧之-字符串

    以模式匹配比较字符串 使用associative arrays 使用Pos函数递归搜索 分离文本为字 分解字符串 加密口令 加密解密字符串 取URL中的文件名 取字符串中的字符排列 在 Case 语句中使用字符串 在Delphi中使用正规表达式 ...

    关于字符串的简单功能实现

    此课程设计的研究对象是字符串,研究的目的就是对字符串进行如下五项基本功能的实现,使大家理解并熟练掌握用汇编语言实施对字符串的操作。基本功能主要有:1.字符串输入操作。此功能地实现主要是通过DOS的0AH号功能...

    C++ 正则文法定义-正则表达式-NFA-DFA-最小化DFA-字符串匹配DFA

    内容主要包括:自定义正则文法(在ProgramManager类中自定义),根据正则文法和输入的正则表达式构建NFA,NFA自动构建DFA,DFA最小化,DFA匹配字符串。其中含有大量的中文注释,并提供了测试方法。本人还是学生,...

    MATLAB代码示例,演示了如何使用字符串数组进行文本处理和自然语言处理(附详细步骤).txt

    这个代码可以对文本进行分句和字符串匹配,并输出匹配结果。具体来说,它首先使用NLTK库中的Punkt分词器将文本转换为句子,然后遍历每个句子,查找其中是否包含字符串数组中的任何字符串。如果找到了匹配的字符串,...

    模糊搜索:该函数查找与模式字符串近似匹配的参考字符串的子字符串-matlab开发

    函数 fzsearch(r,p,n,case) 查找字符串 r(参考)和字符串 p(模式)的子字符串之间的最佳或预定近似匹配。 Levenshtein 距离用作匹配的度量。 Levenshtein 距离是将字符串 A 转换为字符串 B 所需的最小单字符替换、...

    C#实现字符串处理升级版帮助类cs代码

    C# 是一种强类型、面向对象的编程语言,在处理字符串方面具有很多优势,使得字符串操作更加高效和方便。...5. **正则表达式**:C#提供了强大的正则表达式库,可以通过正则表达式灵活地进行字符串匹配和替换,处......

    C#,字符串匹配(模式搜索)有限自动机(Finite Automata)算法的源代码

    图中两个圆圈,也叫节点,用于表示状态,从图中可以看成,它有两个状态,分别叫0和1。...例如,如果当前处于状态0,输入字符是c,那么状态机就会出错,因为从状态0开始,没有哪条边对应的字符是c。

    全能字符串替换机7.0无限制版

    全能字符串替换机用于对文件进行替换、查找、抽取、改名、内码转换等操作。替换功能支持批量文件、批量串的处理,支持超长多行的查找串和替换串,支持动态的替换串;查找功能支持反显查找结果、抽取特定的查找结果;...

    PL/SQL 类型格式转换

    TO_NUMBER(char[,’format_model’]) 字符转换到数字类型 TO_DATE(char[,’format_model’]) 字符转换到日期类型 格式说明符:要与前边要转换的字符串的格式要相同才能转换(匹配问题:格式和位数)。 TO_CHAR...

    全角数字正则匹配后输出半角数字

    全角数字正则匹配后输出半角数字,可以把日期字符串中的全角转换成半角,又便于转换成日期格式

    C#字符串与通配符匹配

    请看以下技巧(尽管分类,但不要认为它是一篇文章):将通配符转换为正则表达式[^]

    字符串、日期、正则匹配工具类

    日期转时间,时间转日期,正则匹配,首字母转大小写,日期工具类,转ASCII码等等

    php判断字符串在另一个字符串位置的方法

    该函数返回字符串的其余部分(从匹配点)。如果未找到所搜索的字符串,则返回 false。 语法复制代码 代码如下:strstr(string,search)输出结果”@exe.com” 您可能感兴趣的文章:php中的Base62类(适用于数值转字符串)...

    C# 字符串处理小工具

    匹配某字符串出现次数 正则匹配 base64加密 base64解密 ROT13加密解密 MD5 32位加密 程序还是非常简陋的,没有健壮性,也没有输入的校验。 用心创造BUG(比心 还有请不要吐槽我的变量命名以及方法命名,如果你不是从...

    c++ 二维字符矩阵,字符串查找

    备注:第一版本时,我认为爬虫的方法不如字符串匹配的方法高效,因此我用了第二种方法。但是项目方回复的消息说60行也能搞定,因此处于工程师的荣耀,我写了第二版本的代码。 采用第一种方法时,参照爬虫设计思想 ...

    XReplace超级字符串批量替换工具3.8官方最新版.rar

    帮助及常见问题问:“超级字符串批量替换工具”可以批量替换Word文档中的页眉页脚内容吗?答:替换前选中“替换Word文档的页眉页脚”复选框即可。 问:替换中的“全字匹配”有什么用?答:全字匹配主要是针对英文和...

Global site tag (gtag.js) - Google Analytics