在 MySQL 的数据检索工作中,字符串条件并不总是简单的等值比较。很多业务字段本身带有结构,例如编号中包含分类前缀、联系方式中带有固定分隔符、用户名中夹带数字或字母组合。此时如果只依赖等值查询,往往需要写很多条件;如果依赖 LIKE,也只能使用有限通配符,难以表达范围、重复次数和位置约束。正则表达式正是为这类模式匹配而设计的工具,它可以用一段规则描述一类字符串形态。
MySQL 通过 REGEXP 关键字把正则表达式引入查询条件。开发者可以把正则规则写在 WHERE 子句中,让数据库逐行检查字段值是否符合规则。这种方式不需要额外配置,也不依赖外部函数,适合在已有表结构上快速完成复杂筛选。对于数据清洗、异常数据排查、规则校验和临时统计分析等场景,正则搜索都能明显提升表达能力。

一、REGEXP 的基本语法与匹配逻辑
使用 REGEXP 时,最常见的写法是在 WHERE 条件中指定字段名、关键字和正则规则。它的基本形式是 SELECT 列名 FROM 表名 WHERE 列名 REGEXP '正则规则';。这里的正则规则是一个 SQL 字符串,通常放在单引号中。只要字段值里存在能够匹配该规则的子串,该行就会被认为满足条件。
这一点与 LIKE 的默认行为不同。LIKE 如果没有写通配符,往往要求整个字段值完全相等;而 REGEXP 默认是部分匹配。例如规则 a 并不是只匹配字段值等于字母 a 的记录,而是匹配任何包含字母 a 的字段值。因此,在使用正则时,要先明确自己是希望包含匹配,还是希望从头到尾完全匹配。如果需要完全匹配,可以借助开头和结尾锚点来限制。
REGEXP 不仅可以用于 SELECT 查询,也可以用于 UPDATE 或 DELETE 的过滤条件。不过,正则匹配通常需要对字符串逐字符计算,难以像普通等值条件那样充分利用索引。因此,在大表上使用正则搜索时,最好先用其他高选择性条件缩小范围,再叠加正则规则,或者将正则用于离线检查、批量清洗等低频操作中。
-- 创建示例表,用于演示 MySQL 正则搜索
CREATE TABLE IF NOT EXISTS user (
id INT AUTO_INCREMENT PRIMARY KEY,
name VARCHAR(100) NOT NULL,
phone VARCHAR(30),
email VARCHAR(120)
);
-- 基础查询:只要 name 中包含字母 a,就返回该记录
SELECT id, name
FROM user
WHERE name REGEXP 'a';
-- 字符集合查询:phone 中包含 0 到 5 之间任意数字即返回
SELECT id, phone
FROM user
WHERE phone REGEXP '[0-5]';
上面的示例展示了最基础的正则查询方式。第一条查询只要 name 字段中出现字母 a,就会返回对应记录;第二条查询使用字符集合规则,只要 phone 字段中包含 0 到 5 之间的任意一个数字,就会命中。两条语句都没有使用通配符,也没有要求字段值完全等于规则内容,这正体现了 REGEXP 的部分匹配特点。
二、常用正则规则:字符集合、锚点与重复次数
在正则表达式中,字符集合是最基础也最直观的规则之一。中括号 [] 用来列出一组允许出现的字符,只要目标字符串中包含其中任意一个字符,就可以匹配成功。例如 [abc] 表示匹配 a、b、c 中的任意一个字符。如果字符具有连续范围,还可以使用连字符 - 简写,例如 [0-9] 表示任意数字,[a-z] 表示任意小写字母。多个范围也可以组合在一起,形成更复杂的字符集合。
锚点用于限制匹配发生的位置。^ 表示字符串开头,$ 表示字符串结尾。如果只写 ^a,表示字段必须以字母 a 开始;如果只写 c$,表示字段必须以字母 c 结束。若同时使用两个锚点,就可以把部分匹配变成完整匹配。例如 ^[0-9]{6}$ 可以表示整个字段必须恰好由六位数字组成,这类规则在编码校验、单号格式检查等场景中非常常见。
量词用于描述前面的字符或字符集合出现多少次。常见的 * 表示零次或多次,+ 表示一次或多次,? 表示零次或一次。{n} 表示恰好出现 n 次,{n,m} 表示至少出现 n 次且最多出现 m 次。这些量词与字符集合搭配后,可以表达诸如连续数字长度、重复字母、可选分隔符等复杂规则。
-- 查询 name 中包含 a、b、c 任意一个字母的记录
SELECT id, name
FROM user
WHERE name REGEXP '[abc]';
-- 查询 name 以字母 a 开头的记录
SELECT id, name
FROM user
WHERE name REGEXP '^a';
-- 查询 name 以字母 c 结尾的记录
SELECT id, name
FROM user
WHERE name REGEXP 'c$';
-- 查询 name 中包含至少一个连续字母 a 的记录
SELECT id, name
FROM user
WHERE name REGEXP 'a+';
-- 查询 name 中包含三到五个连续数字的记录
SELECT id, name
FROM user
WHERE name REGEXP '[0-9]{3,5}';
这组示例覆盖了日常正则搜索中最常用的几类规则。字符集合用于表达多选一,锚点用于约束位置,量词用于约束连续出现的次数。实际编写时,可以把这些规则逐步组合:先确定要匹配的核心字符,再确定它出现的位置,最后确定它出现的次数。这样写出来的正则规则更容易理解,也更容易排查问题。
三、REGEXP 与 LIKE 的选择以及使用注意事项
很多开发者在写模糊查询时会先想到 LIKE,因为它的语法简单,学习成本低。LIKE 主要依赖 % 和 _ 两个通配符,适合处理前缀匹配、后缀匹配和简单包含匹配。但是,当查询条件涉及字符范围、出现次数、固定格式或多组可选字符时,LIKE 的表达能力就显得不足。此时使用 REGEXP 会更自然,也更接近业务规则本身。
可以将两者的差异概括为表达能力和默认匹配逻辑的差异。LIKE 更像简单的模式匹配,写起来直观,但规则有限;REGEXP 更像完整的字符串规则引擎,表达能力强,但需要理解正则语法。选择时并不是越复杂越好,而是看条件是否能被简单通配符清楚表达。如果简单条件用 LIKE 就能完成,就没有必要引入复杂正则;如果条件本身具有明显结构,使用正则反而能减少拼接和判断。
| 对比项 | LIKE | REGEXP |
|---|---|---|
| 匹配模式 | 简单通配符匹配,仅支持 % 和 _ | 完整正则表达式匹配,支持复杂规则 |
| 匹配逻辑 | 默认更接近全字符串匹配,需要通配符实现部分匹配 | 默认部分匹配,包含符合规则的内容即返回 |
| 适用场景 | 简单模糊查询,比如前缀、后缀匹配 | 复杂规则匹配,比如多条件、范围、重复次数匹配 |
使用正则时还需要注意大小写和特殊字符。默认情况下,正则匹配通常不区分大小写,如果业务要求严格区分大小写,可以加入 BINARY 进行二进制比较。特殊字符则需要特别小心,例如 . 在正则中默认表示任意单个字符,如果想匹配真正的点号,就必须进行转义。在 SQL 字符串中,由于反斜杠本身也有转义含义,所以匹配点号的正则通常要写成 \.。
-- 区分大小写:只匹配包含大写字母 A 的 name SELECT id, name FROM user WHERE name REGEXP BINARY 'A'; -- 匹配字面意义上的点号,而不是正则中的通配符 SELECT id, email FROM user WHERE email REGEXP '\.';
除了大小写和转义,正则规则的可维护性也值得关注。过长的正则表达式虽然能一次表达很多条件,但后续修改和排查都会变困难。对于复杂业务,建议将规则拆成多个易于理解的查询条件,或者先在测试数据上验证命中结果,再应用到正式语句中。同时,正则搜索更适合解决格式校验和复杂筛选问题,不宜在所有查询中无差别替代索引条件。
总体来看,REGEXP 为 MySQL 字符串查询提供了更高层的表达能力。掌握基础语法、理解部分匹配逻辑、熟悉字符集合、锚点、量词以及转义规则,就能处理大多数复杂字符串筛选需求。在实际使用中,应当结合数据规模、索引情况和业务可读性,在 LIKE 与 REGEXP 之间做出合适选择,让查询既准确又易于维护。