Python正则匹配一招完整去除文本中的各类表情符号

最新推荐文章于 2025-03-08 19:32:28 发布

原创

最新推荐文章于 2025-03-08 19:32:28 发布 · 7.8k 阅读

35 ·

CC 4.0 BY-SA版权

文章标签：

#python #开发语言 #后端

我们的文本数据中经常会带有很多表情，如何完整地清除得到高质量的文本供我们利用呢？

以“光荣啊，中国共青团🙌🏻💗🚩”为例进行演示：

def clean(desstr,restr=''):  
    #过滤表情   
    try:  
        co = re.compile(u'['u'\U0001F300-\U0001F64F' u'\U0001F680-\U0001F6FF'u'\u2600-\u2B55]+')  
    except re.error:  
        co = re.compile(u'('u'\ud83c[\udf00-\udfff]|'u'\ud83d[\udc00-\ude4f\ude80-\udeff]|'u'[\u2600-\u2B55])+')  
    return co.sub(restr, desstr)

print(clean('光荣啊，中国共青团🙌🏻💗🚩'))

输出如下：