使用ICU库中的正则表达式匹配关键字之间含有特殊字符的关键字示例

2020-06-20 原文

#include "unicode/regex.h"
#include "unicode/ucnv.h"
#ifdef _DEBUG
	#ifdef _WIN64
		#pragma comment(lib,"icuin64d.lib")
		#pragma comment(lib,"icuuc64d.lib")
	#else
		#pragma comment(lib,"icuin32d.lib")
		#pragma comment(lib,"icuuc32d.lib")
	#endif
#else
	#ifdef _WIN64
		#pragma comment(lib,"icuin64.lib")
		#pragma comment(lib,"icuuc64.lib")
	#else
		#pragma comment(lib,"icuin32.lib")
		#pragma comment(lib,"icuuc32.lib")
	#endif
#endif

//每次匹配的内容大小为1M
#define CONTENT_SPLIT_MAX_LEN 1024*1024 //
int FindSubNum(UnicodeString USrcStr,UnicodeString USubStr,int index)
{
	int32_t num = 0;
	int pos = USrcStr.indexOf(USubStr);
	while(pos != -1)
	{
		num++;
		pos += index;
		pos = USrcStr.indexOf(USubStr,pos);
	}
	return num;
}


extern "C"SP_DLP_DLLEXPORT int findKeyPhraseReg(char* buf,char *pat_str,UnicodeString keyphrase)
{
	if(NULL == buf || NULL == pat_str)
	{
		return 0;
	}

	UConverter *cv = NULL;
	UErrorCode status = U_ZERO_ERROR;
	int32_t buf_len = strlen(buf);
	int32_t pat_str_len = strlen(pat_str);
	RegexPattern *reg_pattern = NULL;///正则表达式

	cv = ucnv_open("utf-8"/*detectCode*/,&status);
	if (U_FAILURE(status)) 
	{
		ucnv_close(cv);
		return 0;
	}

	//转换模式串为UnicodeString
	UChar* subStr = new UChar[pat_str_len + 1];
	memset(subStr,(pat_str_len + 1)*2);

	ucnv_toUChars(cv,subStr,(pat_str_len+1)*2,pat_str,pat_str_len,&status);
	if (U_FAILURE(status)) 
	{
		delete[]subStr;
		subStr = NULL;
		ucnv_close(cv);
		return 0;
	}
	ucnv_close(cv);
	UnicodeString patString(subStr);
	//释放空间
	if (subStr)
	{
		delete[]subStr;
		subStr = NULL;
	}

	//Unicode正则表达式组装,这些函数经常代替构造函数来创建RegexPattern对象
	reg_pattern = RegexPattern::compile(patString,status);

	if (U_FAILURE(status)) 
	{
		return 0;
	}
	//把母串转换为Unicode
	UChar* result  = new UChar[CONTENT_SPLIT_MAX_LEN + 1];
	memset(result,(CONTENT_SPLIT_MAX_LEN+1)*2);
	//UChar result[CONTENT_SPLIT_MAX_LEN + 1] = {0};
	cv = ucnv_open(/*detected*/"UTF-8",&status);
	RegexMatcher *reg_matcher = NULL;//匹配器

	//此处说明：
	//1、优点：分批用icu正则匹配待检测内容，每批内容长度为1M。否则当来一个超大文件时，会导致系统不稳定
	//2、缺点：这里分批匹配有缺陷，会导致部分数据被分割后，正则表达式匹配不上。漏掉的匹配次数极限值为分割次数。
	int index = 0;
	int matchNum = 0;
	int src_len = 0;
	while(index < buf_len)
	{
		//将buf中的内容每次1M分批拷入result
		if (buf_len - index > CONTENT_SPLIT_MAX_LEN)
		{
			src_len = CONTENT_SPLIT_MAX_LEN;
		}
		else
		{
			src_len = buf_len - index;
		}
		ucnv_toUChars(cv,result,(CONTENT_SPLIT_MAX_LEN+1)*2,buf + index,src_len,&status);
		index += src_len;
		UnicodeString inputString(result);
		//创建一个正则表达式匹配器
		reg_matcher = reg_pattern->matcher(inputString,status);
		if (U_FAILURE(status))
		{
			delete reg_matcher;
			reg_matcher = NULL;
			continue;
		}
		//virtual UnicodeString replaceAll(const UnicodeString &replacement,UErrorCode &status)
		UnicodeString ustr = reg_matcher->replaceAll(UnicodeString(""),status);
		if (U_FAILURE(status))
		{
			delete reg_matcher;
			reg_matcher = NULL;
			continue;
		}
		int len = keyphrase.length();
		matchNum += FindSubNum(ustr,keyphrase,len);
		//使用完匹配器后要释放
		delete reg_matcher;
		reg_matcher = NULL;
	}
	ucnv_close(cv);
	if(result)
	{
		delete []result;
		result = NULL;
	}
	if (reg_pattern)
	{
		delete reg_pattern;
		reg_pattern = NULL;
	}
	return matchNum;
}

使用ICU库中的正则表达式匹配关键字之间含有特殊字符的关键字示例的更多相关文章

HTML5数字输入仅接受整数的实现代码

这篇文章主要介绍了HTML5数字输入仅接受整数的实现代码,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
ios – 使用大写符号在字符串swift中获取URL的正则表达式

我尝试在文本中获取URL.所以,在此之前,我使用了这样一个表达式：但是当用户输入带有大写符号的URL时(例如Http://Google.com,它与它不匹配)我遇到了问题.我试过了：但什么都没发生.解决方法您可以使用正则表达式中的i内联标志关闭区分大小写,有关可用正则表达式功能的详细信息,请参阅FoundationFrameworkReference.(?ismwx-ismwx)Flagsetti
ios – 应用程序商店描述特殊字符

是不是可以在AppStore描述中使用像星星这样的特殊字符了？我得到这个错误：描述不得包含标记语言.说明不得包含以下字符：★提前致谢：)解决方法仍然允许一些unicode字符.以下字符已经过测试并仍然有效：◆√至于现在他们工作正常,但苹果可以随时再次改变条件.
ios – 如何在Swift 3中使用正则表达式？

解决方法我相信.当没有其他选项适用时,将使用.allZeros.因此,使用Swift3,您可以传递一个空的选项列表或省略options参数,因为它默认为无选项：要么请注意,在Swift3中,您不再使用error参数.它现在抛出.
ios – lldb断点在类目标c中的所有方法

如何使用lldb在ObjectiveC类中的所有方法上自动设置断点？
swift的正则表达式(NSRegularExpression)

init(_pattern:String){varerror:NSError?
swift 正则表达式运用实例选自《swifter 100个swift开发必备tip 》
Swift截取HTML中的所有图片url

在Swift中，要从HTML格式的String中截取出所有的img的所有图片url，要截取的url就要匹配url，需要用到正则表达式。
收藏swift正则表达式的各种验证

1.验证邮箱classfuncvalidateEmail(email:String)->Bool{varemailString="[A-Z0-9a-z._%-]@[A-Za-z0-9.-]\\.[A-Za-z]{2,4}"varemailPredicate=nspredicate(format:"SELFMATCHES%@",emailString)returnemailPredicate.eva
Swift3.0-正则表达式 <待续>

贡献者:赵大财博客:https://my.oschina.net/zhaodacaiGitHub:https://github.com/zhaodacai邮箱:zhaodacai@yeah.comQQ:327532817=============================先直接来代码:NSRegularExpression.OptionscaseInsensitive不区分大小写allowC

随机推荐

法国电话号码的正则表达式

我正在尝试实施一个正则表达式,允许我检查一个号码是否是一个有效的法国电话号码.一定是这样的：要么：这是我实施的但是错了……
正则表达式 – perl分裂奇怪的行为

PSperl是5.18.0问题是量词*允许零空间,你必须使用,这意味着1或更多.请注意,F和O之间的空间正好为零.
正则表达式 – 正则表达式大于和小于

我想匹配以下任何一个字符：或=或=.这个似乎不起作用：[/]试试这个：它匹配可选地后跟=,或者只是=自身.
如何使用正则表达式用空格替换字符之间的短划线

我想用正则表达式替换出现在带空格的字母之间的短划线.例如,用abcd替换ab-cd以下匹配字符–字符序列,但也替换字符[即ab-cd导致d,而不是abcd,因为我希望]我如何适应以上只能取代–部分？
正则表达式 – /bb | [^ b] {2} /它是如何工作的？

有人可以解释一下吗？我在t-shirt上看到了这个：它似乎在说：“成为或不成为”怎么样？我好像没找到’e’？
正则表达式 – 在Scala中验证电子邮件一行

在我的代码中添加简单的电子邮件验证,我创建了以下函数：这将传递像bob@testmymail.com这样的电子邮件和bobtestmymail.com之类的失败邮件,但是带有空格字符的邮件会漏掉,就像bob@testmymail也会返回true.我可能在这里很傻……当我测试你的正则表达式并且它正在捕捉简单的电子邮件时,我检查了你的代码并看到你正在使用findFirstIn.我相信这是你的问题.findFirstIn将跳转所有空格,直到它匹配字符串中任何位置的某个序列.我相信在你的情况下,最好使用unapp
正则表达式对小字符串的暴力

在测试小字符串时,使用正则表达式会带来性能上的好处,还是会强制它们更快？不会通过检查给定字符串的字符是否在指定范围内比使用正则表达式更快来强制它们吗？
正则表达式 – 为什么`stoutest`不是有效的正则表达式？

isthedelimiter,thenthematch-only-onceruleof?PATTERN?
正则表达式 – 替换..与.在R

我怎样才能替换..我尝试过类似的东西：但它并不像我希望的那样有效.尝试添加fixed=T.
正则表达式 – 如何在字符串中的特定位置添加字符？

我正在使用记事本,并希望使用正则表达式替换在字符串中的特定位置插入一个字符.例如,在每行的第6位插入一个逗号是什么意思？如果要在第六个字符后添加字符,请使用搜索和更换从技术上讲,这将用MatchGroup1替换每行的前6个字符,后跟逗号.