如何在MySQL中使用正则表达式进行搜索

来源:AI编程作者:天马头衔:网络博主
导读:本期聚焦于天马创作的《如何在MySQL中使用正则表达式进行搜索》,敬请观看详情。很多开发者在MySQL中做复杂字符串匹配时,默认只会用LIKE关键字,但遇到多条件、模糊规则匹配场景时就会力不从心。这时候正则表达式就能发挥很大作用,MySQL原生支持正则表达式匹配语法,不需要额外安装插件就能直接用。本文会详细介绍MySQL中正则表达式的基础使用方式,包括REGEXP关键字的基础语法、常见匹配规则,还有和LIKE的区别,同时会给出多个可直接运行的示例,帮助大家快速掌握在MySQL中用正则表达式搜索的核心方法,解决实际业务中的复杂查询需求。

在 MySQL 的数据检索工作中,字符串条件并不总是简单的等值比较。很多业务字段本身带有结构,例如编号中包含分类前缀、联系方式中带有固定分隔符、用户名中夹带数字或字母组合。此时如果只依赖等值查询,往往需要写很多条件;如果依赖 LIKE,也只能使用有限通配符,难以表达范围、重复次数和位置约束。正则表达式正是为这类模式匹配而设计的工具,它可以用一段规则描述一类字符串形态。

MySQL 通过 REGEXP 关键字把正则表达式引入查询条件。开发者可以把正则规则写在 WHERE 子句中,让数据库逐行检查字段值是否符合规则。这种方式不需要额外配置,也不依赖外部函数,适合在已有表结构上快速完成复杂筛选。对于数据清洗、异常数据排查、规则校验和临时统计分析等场景,正则搜索都能明显提升表达能力。

一、REGEXP 的基本语法与匹配逻辑

使用 REGEXP 时,最常见的写法是在 WHERE 条件中指定字段名、关键字和正则规则。它的基本形式是 SELECT 列名 FROM 表名 WHERE 列名 REGEXP '正则规则';。这里的正则规则是一个 SQL 字符串,通常放在单引号中。只要字段值里存在能够匹配该规则的子串,该行就会被认为满足条件。

这一点与 LIKE 的默认行为不同。LIKE 如果没有写通配符,往往要求整个字段值完全相等;而 REGEXP 默认是部分匹配。例如规则 a 并不是只匹配字段值等于字母 a 的记录,而是匹配任何包含字母 a 的字段值。因此,在使用正则时,要先明确自己是希望包含匹配,还是希望从头到尾完全匹配。如果需要完全匹配,可以借助开头和结尾锚点来限制。

REGEXP 不仅可以用于 SELECT 查询,也可以用于 UPDATEDELETE 的过滤条件。不过,正则匹配通常需要对字符串逐字符计算,难以像普通等值条件那样充分利用索引。因此,在大表上使用正则搜索时,最好先用其他高选择性条件缩小范围,再叠加正则规则,或者将正则用于离线检查、批量清洗等低频操作中。

-- 创建示例表,用于演示 MySQL 正则搜索
CREATE TABLE IF NOT EXISTS user (
    id INT AUTO_INCREMENT PRIMARY KEY,
    name VARCHAR(100) NOT NULL,
    phone VARCHAR(30),
    email VARCHAR(120)
);

-- 基础查询:只要 name 中包含字母 a,就返回该记录
SELECT id, name
FROM user
WHERE name REGEXP 'a';

-- 字符集合查询:phone 中包含 0 到 5 之间任意数字即返回
SELECT id, phone
FROM user
WHERE phone REGEXP '[0-5]';

上面的示例展示了最基础的正则查询方式。第一条查询只要 name 字段中出现字母 a,就会返回对应记录;第二条查询使用字符集合规则,只要 phone 字段中包含 0 到 5 之间的任意一个数字,就会命中。两条语句都没有使用通配符,也没有要求字段值完全等于规则内容,这正体现了 REGEXP 的部分匹配特点。

二、常用正则规则:字符集合、锚点与重复次数

在正则表达式中,字符集合是最基础也最直观的规则之一。中括号 [] 用来列出一组允许出现的字符,只要目标字符串中包含其中任意一个字符,就可以匹配成功。例如 [abc] 表示匹配 a、b、c 中的任意一个字符。如果字符具有连续范围,还可以使用连字符 - 简写,例如 [0-9] 表示任意数字,[a-z] 表示任意小写字母。多个范围也可以组合在一起,形成更复杂的字符集合。

锚点用于限制匹配发生的位置。^ 表示字符串开头,$ 表示字符串结尾。如果只写 ^a,表示字段必须以字母 a 开始;如果只写 c$,表示字段必须以字母 c 结束。若同时使用两个锚点,就可以把部分匹配变成完整匹配。例如 ^[0-9]{6}$ 可以表示整个字段必须恰好由六位数字组成,这类规则在编码校验、单号格式检查等场景中非常常见。

量词用于描述前面的字符或字符集合出现多少次。常见的 * 表示零次或多次,+ 表示一次或多次,? 表示零次或一次。{n} 表示恰好出现 n 次,{n,m} 表示至少出现 n 次且最多出现 m 次。这些量词与字符集合搭配后,可以表达诸如连续数字长度、重复字母、可选分隔符等复杂规则。

-- 查询 name 中包含 a、b、c 任意一个字母的记录
SELECT id, name
FROM user
WHERE name REGEXP '[abc]';

-- 查询 name 以字母 a 开头的记录
SELECT id, name
FROM user
WHERE name REGEXP '^a';

-- 查询 name 以字母 c 结尾的记录
SELECT id, name
FROM user
WHERE name REGEXP 'c$';

-- 查询 name 中包含至少一个连续字母 a 的记录
SELECT id, name
FROM user
WHERE name REGEXP 'a+';

-- 查询 name 中包含三到五个连续数字的记录
SELECT id, name
FROM user
WHERE name REGEXP '[0-9]{3,5}';

这组示例覆盖了日常正则搜索中最常用的几类规则。字符集合用于表达多选一,锚点用于约束位置,量词用于约束连续出现的次数。实际编写时,可以把这些规则逐步组合:先确定要匹配的核心字符,再确定它出现的位置,最后确定它出现的次数。这样写出来的正则规则更容易理解,也更容易排查问题。

三、REGEXP 与 LIKE 的选择以及使用注意事项

很多开发者在写模糊查询时会先想到 LIKE,因为它的语法简单,学习成本低。LIKE 主要依赖 %_ 两个通配符,适合处理前缀匹配、后缀匹配和简单包含匹配。但是,当查询条件涉及字符范围、出现次数、固定格式或多组可选字符时,LIKE 的表达能力就显得不足。此时使用 REGEXP 会更自然,也更接近业务规则本身。

可以将两者的差异概括为表达能力和默认匹配逻辑的差异。LIKE 更像简单的模式匹配,写起来直观,但规则有限;REGEXP 更像完整的字符串规则引擎,表达能力强,但需要理解正则语法。选择时并不是越复杂越好,而是看条件是否能被简单通配符清楚表达。如果简单条件用 LIKE 就能完成,就没有必要引入复杂正则;如果条件本身具有明显结构,使用正则反而能减少拼接和判断。

对比项LIKEREGEXP
匹配模式简单通配符匹配,仅支持 %_完整正则表达式匹配,支持复杂规则
匹配逻辑默认更接近全字符串匹配,需要通配符实现部分匹配默认部分匹配,包含符合规则的内容即返回
适用场景简单模糊查询,比如前缀、后缀匹配复杂规则匹配,比如多条件、范围、重复次数匹配

使用正则时还需要注意大小写和特殊字符。默认情况下,正则匹配通常不区分大小写,如果业务要求严格区分大小写,可以加入 BINARY 进行二进制比较。特殊字符则需要特别小心,例如 . 在正则中默认表示任意单个字符,如果想匹配真正的点号,就必须进行转义。在 SQL 字符串中,由于反斜杠本身也有转义含义,所以匹配点号的正则通常要写成 \.

-- 区分大小写:只匹配包含大写字母 A 的 name
SELECT id, name
FROM user
WHERE name REGEXP BINARY 'A';

-- 匹配字面意义上的点号,而不是正则中的通配符
SELECT id, email
FROM user
WHERE email REGEXP '\.';

除了大小写和转义,正则规则的可维护性也值得关注。过长的正则表达式虽然能一次表达很多条件,但后续修改和排查都会变困难。对于复杂业务,建议将规则拆成多个易于理解的查询条件,或者先在测试数据上验证命中结果,再应用到正式语句中。同时,正则搜索更适合解决格式校验和复杂筛选问题,不宜在所有查询中无差别替代索引条件。

总体来看,REGEXP 为 MySQL 字符串查询提供了更高层的表达能力。掌握基础语法、理解部分匹配逻辑、熟悉字符集合、锚点、量词以及转义规则,就能处理大多数复杂字符串筛选需求。在实际使用中,应当结合数据规模、索引情况和业务可读性,在 LIKEREGEXP 之间做出合适选择,让查询既准确又易于维护。

MySQL正则表达式REGEXPSQL查询修改时间:2026-06-28 18:18:24

免责声明:​ 已尽一切努力确保本网站所含信息的准确性。网站内容多为原创整理与精心编撰,观点力求客观中立。本站旨在免费分享,内容仅供个人学习、研究或参考使用。若引用了第三方作品,版权归原作者所有。如内容涉及您的权益,请联系我们处理。
内容垂直聚焦
专注技术核心技术栏目,确保每篇文章深度聚焦于实用技能。从代码技巧到架构设计,为用户提供无干扰的纯技术知识沉淀,精准满足专业提升需求。
知识结构清晰
覆盖从开发到部署的全链路。AI、前端、编程、数据库、服务器、建站、系统层层递进,构建清晰学习路径,帮助用户系统化掌握开发与运维所需的核心技术。
深度技术解析
拒绝泛泛而谈,深入技术细节与实践难点。无论是数据库优化还是服务器配置,均结合真实场景与代码示例进行剖析,致力于提供可直接应用于工作的解决方案。
专业领域覆盖
精准对应开发生命周期。从前端界面到后端编程,从数据库操作到服务器运维,形成完整闭环,一站式满足全栈工程师和运维人员的技术需求。
即学即用高效
内容强调实操性,步骤清晰、代码完整。用户可根据教程直接复现和应用于自身项目,显著缩短从学习到实践的距离,快速解决开发中的具体问题。
持续更新保障
专注既定技术方向进行长期、稳定的内容输出。确保各栏目技术文章持续更新迭代,紧跟主流技术发展趋势,为用户提供经久不衰的学习价值。