病毒侵袭持续中-AC自动机

trie树+kmp。。fail指针其实就是相当于kmp那个未优化的next数组,考虑到fail是有方向的,方向可以理解成当前这个(到这个节点为止)的后缀是之前一个短串的后缀,是比root到当前这个短的,所以在统计的时候,才能保证fail往前走就可以。
统计时候,fail数组一直往前,一路相加(这里设置了last数组,就是fail数组中节点是模式串结尾的点)

插入:

void Insert(int v){
    int u = 0,len = strlen(ss[v]);
    for(int i = 0 ; i < len ; i++){
        int tmp = ss[v][i]-'A';
        if(!ch[u][tmp]){
            memset(ch[node],0,sizeof(ch[node]));
            val[node] = 0;
            ch[u][tmp] = node++;
        }
        u = ch[u][tmp];
    }
    val[u] = v;
}
  

fail:

fail指针指向的问题和KMP算法中构造next数组的方式如出一辙。具体方法如下

1)将根结点的所有孩子结点的fail指向根结点,然后将根结点的所有孩子结点依次入列。

2)若队列不为空:

2.1)出列,我们将出列的结点记为curr, failTo表示curr的fail指向的结点,即failTo = curr.fail

2.2) a.判断curr.child[i] == failTo.child[i]是否成立,

       成立:curr.child[i].fail = failTo.child[i],

       不成立:判断 failTo == null是否成立

              成立: curr.child[i].fail == root

              不成立:执行failTo = failTo.fail,继续执行2.2)

   b.curr.child[i]入列,再次执行再次执行步骤2)

若队列为空:结束

//ch【】【】:第二维ascii码范围,开260.
//last数组,就是fail数组中节点是模式串结尾的点)
void  getfail(){
    queue<int> q;
    fail[0] = 0;
    for(int i = 0 ; i < ascs ; i++){
        if(ch[0][i]){  
            fail[ch[0][i]] = 0;
            q.push(ch[0][i]);
            last[ch[0][i]] = 0;
        }
    }

    while(!q.empty()){
        int tmp = q.front();
        q.pop();
        for(int i = 0 ; i < ascs ; i++){
            int u = ch[tmp][i];
            if(u != 0){
                q.push(u);
                int v = fail[tmp];
                while(v && ch[v][i]== 0) v = fail[v];
                fail[u] = ch[v][i];
                last[u] = val[fail[u]]?fail[u]:last[fail[u]];
            }
        }
    }
}

查询:

void Find(){
    int len = strlen(s),j = 0;
    for(int i = 0 ; i < len ; i++){
       // if(s[i] <'A' ||s[i] > 'Z')  continue;
        int tmp = s[i]-'A';
        while(j && ch[j][tmp] == 0) j = fail[j];
        j = ch[j][tmp];

        if(val[j])  cal(j);
        else if(last[j])    cal(last[j]);
    }
}

Problem Description
小t非常感谢大家帮忙解决了他的上一个问题。然而病毒侵袭持续中。在小t的不懈努力下,他发现了网路中的“万恶之源”。这是一个庞大的病毒网站,他有着好多好多的病毒,但是这个网站包含的病毒很奇怪,这些病毒的特征码很短,而且只包含“英文大写字符”。当然小t好想好想为民除害,但是小t从来不打没有准备的战争。知己知彼,百战不殆,小t首先要做的是知道这个病毒网站特征:包含多少不同的病毒,每种病毒出现了多少次。大家能再帮帮他吗?

Input
第一行,一个整数N(1<=N<=1000),表示病毒特征码的个数。
接下来N行,每行表示一个病毒特征码,特征码字符串长度在1—50之间,并且只包含“英文大写字符”。任意两个病毒特征码,不会完全相同。
在这之后一行,表示“万恶之源”网站源码,源码字符串长度在2000000之内。字符串中字符都是ASCII码可见字符(不包括回车)。

Output
按以下格式每行一个,输出每个病毒出现次数。未出现的病毒不需要输出。
病毒特征码: 出现次数
冒号后有一个空格,按病毒特征码的输入顺序进行输出。

Sample Input
3
AA
BB
CC
ooxxCC%dAAAoen….END

#include <iostream>
#include <cstdio>
#include <cstring>
#include <queue>
using namespace std;
int n,node;
const int maxn = 50*1000+10;
const int ascs = 200;
const int mm = 2e6+10;
char s[mm],ss[1010][51];

int ch[maxn][ascs],fail[maxn],val[maxn],last[maxn],cnt[mm];
void Insert(int v){
    int u = 0,len = strlen(ss[v]);
    for(int i = 0 ; i < len ; i++){
        int tmp = ss[v][i]-'A';
        if(!ch[u][tmp]){
            memset(ch[node],0,sizeof(ch[node]));
            val[node] = 0;
            ch[u][tmp] = node++;
        }
        u = ch[u][tmp];
    }
    val[u] = v;
}

void  getfail(){
    queue<int> q;
    fail[0] = 0;
    for(int i = 0 ; i < ascs ; i++){
        if(ch[0][i]){
            fail[ch[0][i]] = 0;
            q.push(ch[0][i]);
            last[ch[0][i]] = 0;
        }
    }

    while(!q.empty()){
        int tmp = q.front();
        q.pop();
        for(int i = 0 ; i < ascs ; i++){
            int u = ch[tmp][i];
            if(u != 0){
                q.push(u);
                int v = fail[tmp];
                while(v && ch[v][i]== 0) v = fail[v];
                fail[u] = ch[v][i];
                last[u] = val[fail[u]]?fail[u]:last[fail[u]];
            }
        }
    }
}

void cal(int j){
    if(j){
        cnt[val[j]]++;
        cal(last[j]);
    }
}

void Find(){
    int len = strlen(s),j = 0;
    for(int i = 0 ; i < len ; i++){
       // if(s[i] <'A' ||s[i] > 'Z')  continue;
        int tmp = s[i]-'A';
        while(j && ch[j][tmp] == 0) j = fail[j];
        j = ch[j][tmp];

        if(val[j])  cal(j);
        else if(last[j])    cal(last[j]);
    }
}

void init(){
    node = 1;
    memset(ch[0],0,sizeof(ch[0]));
    memset(cnt, 0, sizeof(cnt[0])*(n+2));
    for(int i = 1 ;i <= n ; i++){
        scanf("%s",ss[i]);
        //cout << ss[i]<<endl;
        Insert(i);
    }
    getfail();
}

void sov(){
    scanf("%s",s);
    Find();
    for(int i = 1; i <= n ; i ++){
        if(cnt[i] == 0) continue;
        printf("%s: %d\n",ss[i],cnt[i]);
    }
}

int main(){
    while(~scanf("%d",&n)){
       init();
       sov();
    }

    return 0;
}
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 213,752评论 6 493
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,100评论 3 387
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 159,244评论 0 349
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,099评论 1 286
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,210评论 6 385
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,307评论 1 292
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,346评论 3 412
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,133评论 0 269
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,546评论 1 306
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,849评论 2 328
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,019评论 1 341
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,702评论 4 337
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,331评论 3 319
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,030评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,260评论 1 267
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,871评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,898评论 2 351

推荐阅读更多精彩内容

  • 一些概念 数据结构就是研究数据的逻辑结构和物理结构以及它们之间相互关系,并对这种结构定义相应的运算,而且确保经过这...
    Winterfell_Z阅读 5,729评论 0 13
  • 1)这本书为什么值得看: Python语言描述,如果学的Python用这本书学数据结构更合适 2016年出版,内容...
    孙怀阔阅读 12,460评论 0 15
  • 预备知识 Trie(字典树)KMP字符串匹配算法 AC自动机求解问题的类型 一句话概括就是:多模匹配。KMP求解的...
    ZJL_OIJR阅读 1,003评论 0 1
  • 1、 铁人三项 每组5人参赛,共1组,采取一局一胜赛制。第一个项目开始后即开始计时,第一个项目为气球运输,每组2人...
    苏州暮雨阅读 387评论 0 0
  • 孩子正式放寒假了,我们要去爸爸单位住,刚好今天有时间,就带他去他同学家玩玩,可是四个孩子真的好闹腾啊!孩...
    爱你的贝贝阅读 350评论 0 2