zoukankan      html  css  js  c++  java
  • 集思广益,有个几百万关键字的数组的文本匹配的算法

    关键字 都是放在一个数组中的,譬如$keyword_arr=["key1","key2","example",......],大约有几百万甚至上千万的关键字,这些关键字已经按照优先级从前到后排列了,越靠前的关键字优先匹配,匹配的最多次数是$max次;目前采用for循环$keyword_arr数组,然后将关键字组装成'/\b(?:'.$value.')\b/i';正则来匹配文本内容$text;如果已经匹配了$max次了,就停止匹配。

       这个算法肯定是最低效的,大家有好的建议可以提出来,主要问题是关键字优先级有点麻烦

      php: 目前采用正则匹配:

                foreach ($keyword_arr as $key=>$value) {
                    $pattern = '/\b(?:'.$value.')\b/i';
                    preg_match($pattern, $text, $match, PREG_OFFSET_CAPTURE);
                    if ($match && trim($match[0][0]) != '' && !in_array(strtolower($match[0][0]), $match_keyword_arr)) {
                        $match_keyword_arr[] = strtolower($match[0][0]);
                        $count ++;
                        if ($count >= $max) {
                            break;
                        }
                }

  • 相关阅读:
    005.Kickstart部署多系统
    004.Kickstart部署之FTP架构
    003.Kickstart部署之HTTP架构
    C#并发编程之异步编程(二)
    设计模式之策略者模式
    设计模式之职责链模式
    C#并发编程之异步编程(一)
    C#并发编程之概述
    微服务探索与实践—总述
    设计模式之模板方法模式
  • 原文地址:https://www.cnblogs.com/liuminghai/p/3783522.html
Copyright © 2011-2022 走看看