使用Python内置re库封装通用筛选函数,通过两个正则规则分别匹配2-8位字母数字混合编码和4-7位纯数字编号,以空格分割文本并逐个校验,测试样本输出三个有效编码,同时提供扩展方向。
日常文本处理中,经常需要从一堆句子里找出符合特定格式的编号、物料码、零件编码。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
这里用 Python 内置的 re 正则库,封装了一个通用的筛选函数,附上多组测试用例,正则语法怎么拆解、样本怎么匹配、运行结果是什么,都一一列出来,新手也能直接复制了用。
import re
def process_string(input_string):
"""
从输入文本中筛选符合规则的单词片段
匹配规则二选一:
1. 同时包含字母+数字,仅由字母数字构成,长度2~8位
2. 纯数字,总位数4~7位
:param input_string: 输入带空格分隔的文本
:return: 所有符合规则的字符串列表
"""
result_list = []
# 按空格切割文本,拆分出独立单词
word_parts = input_string.split()
# 正则1:匹配字母+数字混合编码,长度2~8,无特殊符号
pattern_mix = re.compile(r'(=.*[a-zA-Z])(=.*d)[a-zA-Zd]{2,8}$')
# 正则2:匹配4~7位纯数字
pattern_num = re.compile(r'^d{4,7}$')
# 遍历每一个拆分后的单词,校验规则
for word in word_parts:
if pattern_mix.match(word) or pattern_num.match(word):
result_list.append(word)
return result_list
# 测试样本集
test_texts = [
'Aceite p04476',
'sdighsg',
's4967xl',
'v0-4985',
'shfsf v0-4985',
'123',
'1234568956',
'45825'
]
# 批量提取所有符合规则的编码
total_result = []
for text in test_texts:
match_words = process_string(text)
total_result.extend(match_words)
# 输出最终筛选结果
print("所有匹配成功的编码:", total_result)
split() 以空格分割整段文字,把一句话拆成独立单词,单独校验每个单词;用于匹配字母数字混合编码。
| 正则片段 | 作用说明 |
|---|---|
(=.*[a-zA-Z]) | 正向预查:字符串必须包含至少 1 个大小写字母 |
(=.*d) | 正向预查:字符串必须包含至少 1 个数字 |
[a-zA-Zd]{2,8} | 整体仅允许字母、数字,总长度限制 2~8 位 |
^ $ | 匹配单词首尾,严格限制整个单词不能包含-、_等特殊符号 |
关键限制:带横杠、点、下划线的字符串直接过滤,比如v0-4985因为存在-就没法匹配。
用于匹配纯数字编号。
| 正则片段 | 作用说明 |
|---|---|
^ | 匹配字符串开头 |
d{4,7} | 只能是数字,长度最少 4 位、最多 7 位 |
$ | 匹配字符串结尾 |
边界规则:3 位数字、8 位及以上数字都会直接过滤。
extend() 将单次结果合并到总列表,一次性收集全部有效编码;| 测试文本 | 拆分单词 | 是否匹配 | 匹配原因 / 过滤原因 |
|---|---|---|---|
| Aceite p04476 | Aceite、p04476 | p04476 | 字母 + 数字混合,长度 6,符合正则 1 |
| sdighsg | sdighsg | 只有字母,无数字 | |
| s4967xl | s4967xl | 字母数字混合,长度 7,符合正则 1 | |
| v0-4985 | v0-4985 | 包含特殊符号-,正则仅允许字母数字 | |
| shfsf v0-4985 | shfsf、v0-4985 | 含减号,无符合规则单词 | |
| 123 | 123 | 纯数字仅 3 位,低于 4 位下限 | |
| 1234568956 | 1234568956 | 纯数字 10 位,超出 7 位上限 | |
| 45825 | 45825 | 纯数字 5 位,4~7 区间,符合正则 2 |
所有匹配成功的编码: ['p04476', 's4967xl', '45825']
修改混合正则,允许-符号:
pattern_mix = re.compile(r'(=.*[a-zA-Z])(=.*d)[a-zA-Zd-]{2,10}$')
需要匹配 3~10 位纯数字,修改正则:
pattern_num = re.compile(r'^d{3,10}$')
分割逻辑替换,兼容多分隔符:
# 同时按空格、逗号分割 word_parts = re.split(r'[ ,]', input_string)
re.compile() 预编译正则,多次调用效率更高;match() 从字符串开头完整匹配,适合校验整个单词;(=...) 实现 “同时包含字母 + 数字” 的复合条件;split() / re.split() 灵活分割文本,拆分独立关键词;or并联,满足任意一条即可命中。侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述