我有下面的代码来检查电子邮件正文中是否有公式内容,但是我不明白这个字符串'<\s?\/?\s?form\s?>'意味着什么,以及是否有另一种方法来检查电子邮件中是否存在公式内容?
这就是我写的代码:
class HTMLFormFinder(FeatureFinder):
def getFeature(self, message):
import re
super(HTMLFormFinder, self).getFeature(message)
payload = utils.getpayload(message).lower()
return re.compile(r'<\s?\/?\s?form\s?>', re.IGNORECASE).search(payload)!= None提前谢谢。
发布于 2019-07-15 15:51:09
这就是所谓的正则表达式。这是一种匹配遵循特定模式的字符串的方法。
https://docs.python.org/3.7/library/re.html
这里,r'<\s?\/?\s?form\s?>'描述了一个<form> html标记,在出现错误/格式错误的HTML时会出现几个回退,特别是它处理标记名称form旁边可能出现的空白。
检查表单是否存在的一种更好的方法是使用XML/HTML解析器,比如ElementTree、BeautifulSoup,因为它们比正则表达式处理糟糕/不正确的HTML要好得多。但是如果你想保持简单,你所拥有的正则表达式就足够了。
使用BeautifulSoup,您可以:
from bs4 import BeautifulSoup
soup = BeautifulSoup(html)
has_form = len(soup.find('form')) > 0发布于 2019-07-15 15:50:42
您可以在这里阅读关于正则表达式的更多信息:https://docs.python.org/2/library/re.html
具体来说,\s与任何空格字符匹配。
https://stackoverflow.com/questions/57043144
复制相似问题