因项目需求需要对帖子标题做去重判断,前提是去除所有中英文标点符号。因为是老项目,gbk编码,在直接使用正则匹配去除标点符号时,发现会有乱码情况。在网上找了一些处理方法,多多少少都有些问题,满足不了我的需求。但也受到了些许启发,开始写了一个实现方法,有些麻烦,需要urlencode。