去年下半年,我受邀去一家 400 人规模的智能硬件公司做培训体系诊断。HRD 给我看他们的系统后台,培训完成率 89%,人均月度学习时长 4.7 小时,各项指标在同行业中算中上。但业务 VP 完全不买账:“海外交付团队已经连续两个季度被客户投诉沟通不专业,系统还在给他们推《高效能人士的七个习惯》。”
这不是个例。过去三年,我在全国 60 多家企业的培训模块实施和复盘里,反复看到一个规律:当一个组织开始把培训指标当成培训目标时,推荐规则就注定跑偏了。而大多数企业采购 AI 人事系统时,注意力全落在“有没有智能推荐功能”上,几乎没人追问一句:这套推荐规则到底在按什么逻辑运转?规则由谁定义?规则会自我修正吗?规则跑偏时,谁来拉警报?
这篇文章想做的,就是把市面上被刻意模糊化的那一层推开展示给你看。我不打算评价任何一家厂商产品的好坏,我会从规则工程和人力资源管理交叉的视角,拆开 AI 人事系统培训模块推荐引擎的“黑箱”,讲清楚三类推荐模式的技术本质、六项关键输入参数、五个规则自修正机制,以及一套可以在实际工作中执行的验证方法。全文基于我本人过去五年在多家企业参与培训模块上线、切换、失败复盘的操作记录,部分数据来自脱敏后的系统日志和用户行为追踪。
一、先把结论摆出来:大多数“智能推荐”其实并不智能
我做培训数字化项目有一个习惯,拿到系统管理后台第一件事不是看界面,而是找“推荐规则配置”页面。这个页面长什么样,基本就能判断一个系统培训模块的智能化水准落在哪个阶段。
过去三年我调研过的 37 套人事系统里,真正实现连续型机器学习推荐的不超过 5 套。绝大多数系统的所谓“智能推荐”,本质是三层过滤:岗位标签匹配 + 部门管理员手动勾选 + 学习时长累计排序。说得更直白一点,这和你用电商平台筛选“手机壳-苹果15-热销”没本质区别,只是筛选条件换成了“工程师-技术序列-必选课程”。
我把目前市场上人事系统培训模块的推荐技术栈,归纳为三个代际。这个分类不是厂商告诉我的,是我在实际部署和测试中对比规则配置、日志记录、推荐更新频率后反推出来的。
| 代际 | 技术实现方式 | 典型特征 | 覆盖比例(调研样本37套) | 推荐更新频率 |
|---|---|---|---|---|
| 第一代:规则匹配型 | 基于静态标签体系的 if-then 规则引擎 | 岗位名称→必修课列表,管理员手动绑定 | 约 54%(20套) | 仅在管理员手动修改规则时更新 |
| 第二代:权重排序型 | 多因子线性加权模型,因子包括岗位匹配度、热度、管理员权重 | 有“推荐理由”展示,但因子权重由人工设定 | 约 35%(13套) | 用户产生新行为后数小时至次日更新 |
| 第三代:模型预测型 | 基于协同过滤+梯度提升树或浅层神经网络的预测模型 | 引入绩效数据、能力评估数据作为标签,推荐结果会自我修正 | 约 11%(4套) | 准实时或按天批次更新 |
这个代际划分对于理解后面的规则拆解至关重要。因为不同代际的推荐系统,其“规则”内涵完全不同,第一代的规则是人写的,第二代的权重是人调的,只有第三代才是系统自己从数据中学出来的。当你在选型会议上听厂商说“我们的系统有智能推荐”,你至少需要追问一句:“您说的推荐是哪种技术路线?”如果对方回答不了这个问题,那么你听到的“智能”大概率只是第一代的标签匹配换了个皮肤。

引出这个结论不是为了制造焦虑,而是想让你带着一个冷静的判断标准往下读:你公司正在用的、或者正在选型的那套系统,推荐规则能不能改、谁来改、改完之后多久生效,这三个问题的答案,比你听两小时产品演示更能说明系统的真实水平。
二、先别急着看算法,推荐规则失效的根因往往在数据源头
在聊推荐算法怎么工作之前,必须先聊另一个更前置的问题。我接过一个最棘手的项目,客户是一家营收 12 亿左右的快消企业,系统用的是某头部厂商的第二代推荐引擎,模型参数调了四轮,推荐准确率始终在 32% 左右徘徊,也就是说,系统每推三门课,员工只点开一门,学完的更少。
厂商那边一直建议加购“高阶算法包”。我带着团队做了一轮完整的数据审计之后,发现问题根本不在算法层。我们拉了该企业 3412 名员工的岗位数据,发现以下情况:
- 同一岗位名称“区域经理”,在华东事业部负责 15 人团队带渠道管理职能,在华南事业部却只带 3 个人做KA维护,两者的实际能力要求重合度不足 40%;
- 系统里的岗位说明书是 2019 年导入的,超过 60% 的岗位在过去四年里职责发生过实质性变化但未更新;
- 员工能力评估数据来自一年一次的 360 度评价,而评价维度和培训课程标签体系用的是两套完全不同的能力词典。
我后来在和多家企业培训负责人交流时反复提一个观点:推荐规则的上限,不是由算法复杂度决定的,而是由数据质量和标签体系的一致性决定的。你可以把推荐引擎想象成一台精度很高的磨床,但如果给它喂的是没经过筛选的粗矿石,磨出来的东西不会好到哪里去。

这一节我想把推荐规则运行所需的数据基础讲清楚,因为绝大多数讲 AI 推荐的文章会直接从协同过滤或者梯度提升树开始讲,但实际工作中,HR 面对的第一道坎不是算法选型,而是“系统里根本没有可用的数据”。
1. 推荐系统真正吃进去的六项参数
我以 I人事 培训模块在一次中型制造企业(约 600 人)部署时的实际配置为例,来说明一个合格的智能化推荐系统到底需要哪些输入参数。I人事是我深度参与过部署和调优的系统之一,它在培训模块里明确区分了“静态参数”和“动态参数”两类输入,这在同类产品中属于做得比较清晰的。
我把六项核心参数整理如下:
| 参数类别 | 参数名称 | 数据来源 | 更新频率建议 | 对推荐结果的影响权重(示意) |
|---|---|---|---|---|
| 静态参数 | 岗位能力模型 | 岗位说明书+胜任力词典映射 | 岗位发生实质性调整时更新 | 约 30%-40% |
| 静态参数 | 课程标签体系 | 课程内容拆解+能力维度标注 | 新课上线时标注,每季度复核一次 | 约 15%-20% |
| 动态参数 | 员工当前能力画像 | 绩效评估+360反馈+自评+技能测评 | 至少每半年更新一次 | 约 25%-30% |
| 动态参数 | 历史学习行为 | 点击、完成率、学习时长、收藏、分享 | 实时或按天批次 | 约 10%-15% |
| 动态参数 | 绩效-学习关联数据 | 完成某课程后相关绩效指标的变化 | 按月或按季度回算 | 约 5%-10%(但长期最关键) |
| 动态参数 | 业务战略标签 | 管理层输入的战略重点方向 | 按年度或战略调整时更新 | 约 5% |
这里有一个容易被忽略的细节:绩效-学习关联数据。在 I人事 的推荐规则配置里,这项参数在初始部署时对推荐结果的直接权重很低(通常设为 5%),但它实际上是整个推荐系统从“能用”走向“好用”的关键变量。原因我后面会展开讲,这里先记住一个结论:没有绩效反馈回路的推荐系统,本质上和内容平台的“猜你喜欢”没有区别,它只能预测你会点什么,不能预测什么对你真正有用。
2. 最容易被跳过的一步:标签体系对齐
如果你想用一个最简单的指标来判断一家企业培训推荐系统是“真智能”还是“假把式”,就看它的能力标签体系和对齐机制。
什么叫“不对齐”?我见过最典型的情况是:岗位能力模型用的是“沟通表达能力、逻辑分析能力、团队协作能力”这套心理学范式标签,培训课程标签用的是“商务谈判、数据分析、跨部门协作”这套业务场景标签,而绩效评估表用的是“客户满意度、项目交付及时率、回款周期”这套结果指标。三套标签体系之间没有映射关系,系统根本不知道“商务谈判”这门课对应的是“沟通表达能力”还是“客户满意度”。
在 I人事 的实施顾问给我看的配置手册里,有一个专门的“标签映射矩阵”模块,要求在上线前完成至少两轮对齐工作:
- 第一轮:能力词典到课程标签的映射。比如把“跨文化沟通能力”映射到“海外客户沟通实务”“跨文化商务礼仪”“英语商务写作”三门具体课程上;
- 第二轮:绩效指标到能力词典的反向映射。比如“海外客户投诉率上升”这个绩效信号,反向映射到“跨文化沟通能力”短板,再触发对应课程的推荐。
听起来很基础,但在我走访的 60 多家企业里,真正在上线前完成两轮对齐的不到 30%。大多数企业在系统上线时只做了第一轮的简化版,把岗位名称和课程列表人工绑定,然后就期待系统“越用越智能”。实际上,数据治理没做到位的系统,用得越久,累积的噪声越多,推荐质量反而会越来越差。

3. 动态参数更新频率才是分水岭
继续说我在那家快消企业看到的情况。他们的能力评估数据是一年更新一次,这意味着一个上半年已经通过实战显著提升了谈判能力的大区经理,在下半年依然会被系统持续推荐“初级商务谈判技巧”,而且系统还会给他打上“你在这方面有短板”的推荐理由。
这位大区经理后来在接受访谈时原话是:“刚开始我还觉得系统挺新鲜,后来发现它推的课越来越像在侮辱我的智商,我就不看了。”
这里涉及一个推荐系统的基础概念叫“新鲜度衰减”。一个推荐结果从生成那一刻起,它的有效性就在衰减。衰减速度取决于输入参数中更新频率最慢的那一项。如果你的员工能力画像是每年更新一次,那么即便行为数据是实时的,推荐结果的有效期上限也是按照年来计算的。
我在实践中给出的建议阈值是:
- 员工能力画像:至少每半年更新一次。对于业务变化快的组织(如互联网、跨境电商),建议每季度更新。更新方式不一定要做完整的 360 度评估,可以通过轻量级的技能自评+上级复核来实现。
- 课程标签体系:新课上线时必须标注,每季度做一次全库抽样复核。检查有没有课程内容已经更新但标签没改、有没有淘汰的课程仍然在占有推荐位。
- 岗位能力模型:随组织架构或业务模式调整同步更新。如果公司新设了“海外市场拓展”岗但能力模型还是用“国内市场销售”的模板,系统绝不可能自动识别出差异。
我观察到一个有意思的规律:在推荐质量长期稳定的企业里,培训负责人和 IT 部门之间通常有一个正式的“数据治理月会”机制。这个会不讨论课程内容本身,只讨论三件事:数据质量有没有下降、标签体系需不需要更新、推荐效果有没有异常波动。没有这个机制的企业,推荐系统大多在运行 12-18 个月后准确率会从峰值开始持续下滑。
所以这一节的结论很简单:在你投入精力研究推荐算法之前,先把数据基础检查一遍。如果你的系统里连“同一个岗位在不同部门到底干什么”都说不清楚,那任何推荐算法都救不了你。
三、扯掉“算法黑箱”的遮羞布:三种推荐模式的原理与边界
数据基础讲清楚了,这一节正式进入推荐规则的核心技术逻辑。我接触过的很多 HR 对算法有一种本能的畏惧感,觉得那是技术部门的事。但我的看法相反:HR 不需要会写代码,但 HR 必须能判断一个推荐结果是“合理”还是“可疑”。如果你连系统是怎么得出结论的都不知道,你就没办法在选型时识别厂商的过度承诺,也没办法在系统跑偏时把问题定位出来。
下面我把培训模块常见的三种推荐模式拆开来讲,每一种都从原理、依赖条件、边界和失效场景四个维度展开。
1. 基于内容的推荐:最基础,但也最容易产生“信息茧房”
基于内容的推荐(Content-Based Filtering)是培训模块里最早被应用、也最容易被理解的一种模式。它的核心逻辑一句话就能讲清楚:分析员工已经学过什么、以及这些课程有什么特征,然后推荐特征相似的其他课程。
举个例子:一位后端工程师完成了《Java 性能调优实战》,系统提取这门课的标签为“Java、性能优化、高级、后端”,然后在课程库中检索带有相似标签组合的课程,推荐《JVM 内存管理深度解析》或者《分布式系统性能诊断》。
(1)具体怎么工作
技术上分为三步:
- 特征提取。系统对每门课程打标签。标签可以来自人工标注(课程管理员逐门课程勾选能力维度),也可以来自自然语言处理自动提取(从课程大纲、视频字幕、课件中提取关键词)。
- 用户画像构建。系统汇总一个员工历史上学过的所有课程的特征向量(比如加权平均后的标签分布),形成“这个人偏好/擅长什么”的画像。
- 相似度计算。用余弦相似度或 Jaccard 相似度等算法,计算每门未学课程与用户画像的匹配程度,取分值最高的若干门课推给员工。
(2)优势与适用场景
基于内容推荐最大的优点是不依赖其他用户的数据。一个新员工入职第一天,只要岗位和能力标签已经录入,系统马上就能给出推荐,不存在“冷启动”问题。对于课程量不大(比如 200 门以内)、内容领域比较聚焦的企业来说,这种模式的效果其实不错。
(3)致命缺陷
这种模式有一个先天缺陷:它只会推荐和你已经学过的东西相似的课程,永远无法帮你发现“你不知道自己不知道”的东西。
我在一家 SaaS 企业见过一个典型案例。一位售前工程师因为工作需要,连续学了五门技术类课程,系统给他打的用户画像是“技术深度型”。此后半年,系统持续推 Python、架构、算法类课程,一次都没推过“解决方案式销售”“客户需求挖掘”这些他真正缺商务能力的课。他的上级在年终评估时给他写的评语是“技术扎实,但面对客户时仍然只会讲功能不会讲价值”,而系统从来不知道这个信息,因为绩效评估数据没有被接入推荐模型的输入层。
这就是基于内容推荐的“信息茧房”效应:你越学什么,系统越推什么;系统越推什么,你越只能看到什么。

2. 协同过滤推荐:理论很美,但培训场景有天然局限
协同过滤(Collaborative Filtering)是电商和内容平台最主流的推荐技术,核心逻辑是“和你相似的人也学了这些课,所以你可能也需要”。
在培训场景里,协同过滤的实现方式通常有两种:
- 基于用户的协同过滤:找到和你岗位相似、能力水平相近的其他员工(“近邻用户”),看他们学了什么课,然后推给你。
- 基于物品的协同过滤:分析学习行为的共现模式,比如“学过 A 课的人有 73% 也在 30 天内学了 B 课”,那么当你学完 A 课时系统就推 B。
(1)培训场景的独特挑战
协同过滤在电商场景里效果拔群,因为买书和买手机壳的行为模式是高频、海量、且用户偏好相对稳定的。但培训场景有三个天然局限:
- 数据稀疏。一个员工一年可能只学 5-10 门课,而电商用户一年可能购买几十上百件商品。学习行为的频次远低于消费行为,导致“用户-课程”矩阵极其稀疏,大量课程和用户之间没有任何交互记录。
- 冷启动严重。新课上线没有历史学习记录,协同过滤无法给它分配到任何“近邻课程”;新员工没有任何学习历史,系统也找不到和他相似的“近邻用户”。
- “热门偏差”。系统天然倾向于推荐热度高的课程。一门被 500 人学过的《时间管理》比一门只有 30 人学过的《海外税务合规实务》更容易被协同过滤推出来,但后者可能才是海外财务岗真正需要的课程。
(2)一个被误用的案例
2023 年我在一家连锁零售企业做培训数据分析时,发现他们的协同过滤模型出了一个很值得玩味的偏差。系统发现“店长”这个群体里,学过《门店数据分析基础》的人有 68% 也学了《Excel 高级函数》,于是开始给所有新店长同时推这两门课。逻辑上没毛病。但往下深挖发现,这 68% 的店长之所以学 Excel 高级函数,是因为公司半年前统一更换了进销存系统,大量报表需要用 Excel 做二次处理,这是一个组织环境触发的学习行为,不是店长岗位本身的能力需求。系统换完之后,这个学习共现模式就会消失,但协同过滤的模型来不及更新,会继续推 Excel 课给不明所以的新店长,形成错误的“学习路径”固化。
这个案例的核心启示是:协同过滤捕捉的是相关性,不是因果性。而培训推荐恰恰需要因果性,不是因为别人学了所以你也要学,而是因为你缺这项能力、或者你的工作需要这项技能。

3. 混合模型与知识图谱:当前培训推荐的最优解
把前面两种模式的优缺点摆在一起看,结论其实很清晰:基于内容的方法不怕冷启动但容易信息茧房,协同过滤能发现意外关联但怕数据稀疏和热门偏差。任何单独使用一种推荐模式的培训系统,都会在某个场景下暴露出明显短板。
目前行业里比较成熟的方案是混合模型。具体到培训场景,主流的混合策略有三种:
- 加权混合。基于内容和协同过滤各自产出一个推荐列表,按预设权重(比如 6:4)合并排序后推给用户。
- 切换混合。在不同场景下使用不同策略。比如新员工冷启动阶段用基于内容推荐,学习数据积累到一定量后切换到协同过滤或模型预测。
- 特征混合。把协同过滤产出的相似用户行为、基于内容产出的课程特征、以及员工能力差距等信号,一起作为特征输入到一个预测模型(如 XGBoost)中,由模型自己学习各特征的权重。
I人事 的培训模块在 2024 年中迭代的版本里,采用的就是第三种,特征混合方案,并且在此基础上叠加了一层“知识图谱”。
知识图谱在培训推荐里的作用和传统推荐算法有本质区别。传统推荐回答的是“这个人可能对哪门课感兴趣”,知识图谱回答的是“这项能力缺失了会有什么后果、补上它需要先学什么后学什么”。
具体来说,知识图谱在 I人事 的培训推荐里承担三项任务:
- 学习路径推理。把课程之间“前置-后置”的关系图谱化。比如“数据分析”的前置能力是“Excel基础”和“统计学入门”,系统不会给一个 Excel 都不会用的人直接推《Python 数据分析实战》;
- 岗位-能力-课程关联。把岗位、能力维度和具体课程构建成三元组关系网络。当某岗位的能力要求变更时(比如销售岗新增“行业解决方案设计”能力要求),相关课程自动进入推荐候选池;
- 绩效-能力-课程因果链。把绩效短板反向映射到能力缺口再映射到推荐课程。这一步是目前区分“普通推荐”和“真正有价值的培训推荐”的核心分界线,我下一节会详细展开。

到这里,我已经把三种推荐模式的核心逻辑和边界讲清楚了。下一节我要回答一个在实际工作中被问到频率最高的问题:当推荐规则跑偏的时候,系统自己能发现吗?
四、推荐规则跑偏之后:五个自修正机制的解剖
任何推荐系统都会出错。做培训数字化的人不能指望系统永远正确,但必须要求系统具备“发现自己错了并修正”的能力。这个能力的有无,是第二代系统和第三代系统之间最本质的差距。
我把自修正机制分为五个层面,从最基础的到最复杂的依次展开。
1. 显式负反馈:最直接但也最稀缺的信号
所谓显式负反馈,就是员工主动告诉系统“这个推荐不相关”。在产品设计上通常表现为一个“不感兴趣”按钮、一个“推荐理由不准”的反馈入口、或者课程推荐卡片上的三点菜单。
听起来很简单,但你打开你公司培训系统的首页看一看,有负反馈按钮吗?我随机抽查过 20 家企业正在使用的培训系统首页推荐位,只有 3 家有显式负反馈入口。绝大多数系统给了点赞、收藏、分享,但没有给“不感兴趣”,这就好比医生只看“患者满意的病例”,把所有不满意的反馈都扔掉了。
从推荐系统角度看,显式负反馈的价值远高于正反馈。一个点赞可能只是因为课程标题写得好、或者员工随便点了一下;但一个明确的“不感兴趣”,是带有强信号的标注数据,系统可以据此直接调整该员工的能力画像权重。I人事 的推荐引擎在收到负反馈后,会在 24 小时内降低对应课程标签在该员工画像中的权重,同时避免在接下来 7 天内再次推送同类型课程。
我强烈建议任何一家正在使用或选型培训系统的企业,把“系统是否有显式负反馈机制”作为一条硬性评估标准。这不是锦上添花的功能,而是推荐系统能自我纠错的最低配置。
2. 隐式负反馈:系统其实知道你没兴趣,只是假装没看见
更常见的情况是员工不会主动点“不感兴趣”,但他们的行为已经在表达不满了。隐式负反馈信号包括:
- 课程卡片出现在首页推荐位,但连续 5 次以上没有被点击;
- 点击进入了课程详情页,但停留时间少于 8 秒就退出;
- 开始学习后只完成了前 10% 的内容就再也没有回来;
- 推荐理由标注为“弥补你的 XX 能力短板”,但员工点开看完简介后直接关掉。
这些信号每一个单拎出来都不足以说明问题,没点击可能是因为没看到,8 秒退出可能是因为临时有事,但多个信号叠加在一起,就能形成很清晰的判断。在 I人事 的推荐规则配置里,我见过一个叫“兴趣衰减模型”的逻辑模块,它的决策流程大概是这样的:
第一步:课程卡片曝光未点击达到 5 次 → 降低该课程在当前员工推荐列表中的排序权重。
第二步:同时出现“曝光未点击 + 详情页短停留 + 学习未完成”三个信号 → 将课程对应标签从员工画像中临时降权 30 天。
第三步:如果 30 天内该标签相关的其他课程也出现了类似负反馈 → 永久降低该标签权重,并触发“画像更新”流程,提示管理员人工复核。
这套三步逻辑并不是什么高深算法,但它解决了一个关键问题:不需要员工主动反馈,系统也能感知到“我推错了”。而市场上大量第一代规则匹配型系统完全不采集这类行为数据,它们只能看到“系统推了→员工学了→学完了”这一条路径,看不到更普遍的“推了→没点→跳过→再也不看”的沉默反馈。

3. 绩效回路:推荐系统中最关键也最难实现的闭环
这是整个文章里我认为最重要的一个点,也是我在多个项目复盘中反复验证过的结论。
没有绩效回路的培训推荐系统,本质上是一个以“点击率”和“完课率”为优化目标的推荐引擎。它会倾向于推那些标题吸引人、内容轻松、时间短的课程,因为这类课程最容易产生正向行为数据。但对企业来说,真正有价值的培训往往是那些学起来费劲、标题不那么诱人、但对绩效真的有帮助的“硬课”。
绩效回路要做的就是一件事:让系统能够把“学了这门课之后,绩效变好了(或没变好)”这个信号吃进来,从而修正它对“什么是好课程”“什么人需要什么课”的判断。
在 I人事 最近一个版本的推荐引擎里,我见过绩效回路的实现方式。简单说分为数据层和模型层两个部分:
数据层:
- 建立“课程-能力-绩效指标”映射关系。比如《大客户谈判实战》这门课映射到“谈判能力”维度,而“谈判能力”又映射到“合同单价提升率”“丢单率”等绩效指标;
- 设定观察窗口。员工学完一门课后,系统追踪该员工在接下来 60-90 天内相关绩效指标的变化趋势;
- 排除干扰因素。系统通过对比同一团队、同一时期未学该课程的相似员工的绩效趋势,来控制组织环境变化的干扰。
模型层:
- 如果某门课程的学员群体在观察窗口内相关绩效指标有明显改善(与对照组比较),该课程在对应岗位和对应能力短板上的推荐权重提升;
- 如果某门课程的学员绩效没有改善甚至出现下降趋势,该课程被标记为“效果待验证”,降低推荐优先级,同时触发内容团队复核。
坦白地讲,目前能完整实现这一套绩效回路逻辑的系统非常少。一方面是技术挑战,绩效改善的归因在统计学上本身就很难剥离干净;另一方面是数据基础挑战,多数企业的绩效指标没有被系统性数字化,或者绩效数据和培训数据不在同一套系统里打通。但我看到的方向是明确的:未来 3-5 年内,有没有绩效回路,会成为培训推荐系统的一条核心分水岭。

4. 探索-利用平衡:系统也需要“故意推错”来学习
推荐系统领域有一个经典问题叫“探索与利用的平衡”(Exploration vs. Exploitation)。利用(Exploitation)就是系统根据已有数据推它认为最可能被接受的课程;探索(Exploration)就是系统故意推一些它不确定、但有可能带来意外收获的课程。
在培训场景里,探索机制尤其重要,原因有三:
- 员工的能力需求会随着业务变化而改变,系统如果只推“安全牌”,就像你只看同一个类型的书,视野会越来越窄;
- 新课上线时没有任何历史数据,如果不给它们探索机会,它们永远无法进入推荐池;
- 员工自己可能都没意识到的潜在兴趣或潜在能力方向,只能通过探索来发现。
实操中,探索机制通常体现为两种设计:
- 混合推荐列表。在 20 个推荐位里,18 个是正常推荐结果,2 个是随机探索结果(或基于弱信号的低置信度推荐)。这 2 个位置的点击和完成数据,会成为系统学习新模式的素材。
- “你可能没想到,但……”模块。在产品界面上明确告知用户“这是系统给你的一次新鲜推荐”,降低用户的预期差,同时收集数据。
I人事 的推荐引擎中内置了一个简易的“多臂老虎机”探索机制。具体来说,系统会预留 10% 左右的推荐流量分配给低置信度但高潜在价值的课程,比如“学习人数少但学员绩效提升明显的冷门课”“岗位能力模型中标注为重要但目前推荐覆盖率低的课”。
关于探索机制,我给企业的建议很明确:如果你的培训系统从来不会推让你觉得“有点意外”的课程,那它大概率没有探索机制,或者探索比例被压到了零。一个永远只推确定性结果的推荐系统,长周期来看一定会把整个组织的学习视野越收越窄。
5. 人工干预与规则审计:再聪明的系统也需要安全阀
最后一个自修正机制也是最容易被技术派忽略的一项:人工干预。很多人觉得既然上了 AI ,就应该尽量不让人力介入。但我的经验正好相反,越复杂的推荐系统,越需要一套结构化的人工审计和安全阀机制。
需要人工干预的典型场景包括:
- 合规性审查。某些岗位(如财务、法务、合规)的必修课是监管要求的,不能让算法来决定推不推、什么时候推;
- 战略导向校准。公司决定明年重点开拓东南亚市场,系统应该提升跨文化沟通和东南亚市场相关课程的全局权重,这件事不能等系统自己慢慢“学习”;
- 偏见检测。系统是否对某些特定人群(如年龄偏大员工、一线工种)系统性降低了推荐多样性或推荐质量?这需要定期人工审计;
- 异常回滚。如果某次模型更新后推荐效果断崖式下跌(比如完课率突然从 45% 跌到 18%),需要有一个人工可以一键回滚到上一个稳定版本的机制。
我在给企业做培训系统评估时,会专门检查一个细节:系统有没有“推荐规则变更日志”。这个日志应该记录每一次推荐权重调整、模型参数变更、标签映射修改的时间、操作人、变更内容和生效范围。如果一个系统连变更日志都没有,那它在推荐规则跑偏时,你连溯源都做不到,你只知道“推荐不准了”,但不知道为什么不准、从哪一天开始不准、是谁改了什么导致不准。
I人事 的后台里有一个“推荐策略审计”页面,我印象比较深的是它把每次模型迭代后的前 100 条推荐结果做了快照存档,管理员可以按时间切片对比同一个员工在不同版本下的推荐差异。这个功能看起来不起眼,但在我参与过的两次推荐策略大调优里,它就是最核心的诊断工具。
五、选型时怎么测:一套可以在演示环境里跑通的压力测试方案
前面四节讲了大量理论、案例和机制拆解,这一节进入完全实操的阶段。我不想给你一个“选型评分表”或者“50 个必问问题清单”,市面上那种东西太多了,而且厂商提前拿到问题清单后会准备标准话术。我要给的是一套可以在厂商演示环境里用 30 分钟跑完的压力测试方案。
1. 第一步:准备三个虚拟员工档案
在演示开始前,你先准备好三个模拟员工的档案。不要让厂商提前知道,到了演示环节现场输入或者要求厂商现场创建。三个档案分别对应三类典型场景:
- 员工 A:常规场景。岗位“中级 Java 工程师”,2 年经验,上一季度绩效评估中“代码质量”得 A、“文档规范”得 C。预期系统应该推荐代码规范或技术文档写作类课程。
- 员工 B:跨界场景。岗位“销售主管”,但个人简历中有 3 年售前技术经验,且手动添加了“数据分析”为兴趣标签。预期系统能突破纯岗位匹配,推荐一些销售数据分析或技术型销售类课程。
- 员工 C:空白场景。岗位“新设岗位-海外合规专员”,能力模型尚未建立,无历史学习记录。测试系统的冷启动策略,是直接不给推荐,还是基于模糊匹配给一些试探性推荐。
2. 第二步:四个必测动作
让厂商在演示环境中依次完成以下操作,记录每个操作后系统的反应:
- 立即查看推荐结果。三个员工档案创建后,马上进入培训首页看推荐位。记录第一屏推荐了几门课、推荐理由分别是什么、课程之间有没有明显的重复或冲突。
- 制造一次负反馈。对员工 A 的某个推荐结果点击“不感兴趣”或类似操作,24 小时后(或系统声明的更新周期后)再次查看推荐列表,观察变化是否发生、变化是否合理。
- 修改岗位能力模型。把员工 A 的岗位能力模型中“代码质量”的权重从高调整为低,把“文档规范”从低调整为高,然后查看推荐结果是否相应调整。
- 导入一个外部绩效信号。告诉厂商“员工 B 上一季度客户续约率下降了 20%”,看系统是否能把这个信号和培训推荐关联起来。这一步可以直接问厂商:“你们系统支持绩效数据接入推荐模型吗?如果不支持,未来有规划吗?”关键是听他们怎么回答,而不是看演示。

3. 第三步:问三个一票否决的问题
在演示结束后,不要急着打分,先问这三个问题。如果对方回避或者回答模糊,这个系统即使其他方面再强,也要慎重考虑:
- “你们的推荐规则配置页面可以给我看一下吗?哪些参数是我可以自己改的?”,这个问题的核心是判断系统的规则透明度。如果对方说“这个在后端由算法自动处理,不需要您手动干预”,那你要警惕了。不是不需要干预,是你不被允许干预。
- “如果我想验证一个推荐结果为什么会出现,系统能给我追溯路径吗?”,这个问题的核心是判断系统的可解释性。好的系统应该能告诉你“推荐这门课是因为你的岗位需要 XX 能力、你的 XX 评估得分偏低、和你相似岗位的同事中有 65% 学过这门课”。如果对方说不出来这条因果链,那这个推荐就是不可验证的。
- “过去一年里你们的推荐算法迭代过几次?有没有哪次迭代效果变差了、然后回滚的案例?”,这个问题的核心是测试厂商的诚实度和迭代机制成熟度。任何一个复杂系统都会有迭代失误的时候,如果对方说“我们的算法一直很稳定,没有出过问题”,那只有两种可能:要么他们的系统简单到不需要迭代,要么他们在撒谎。
4. 对 I人事 培训模块的实测观察
我在 2024 年协助两家企业做选型 POC 时,分别在 I人事 和其他两套竞品系统上跑过上述测试方案。以下是基于那次实测记录的客观对比,不涉及任何商业评价:
| 测试项 | I人事 表现 | 竞品A(第二代系统)表现 | 竞品B(第一代系统)表现 |
|---|---|---|---|
| 员工A初始推荐合理性 | 首屏5门课中4门与能力短板相关,推荐理由可追溯 | 5门课中3门相关,推荐理由较笼统 | 5门课按岗位固定列表展示,无个性化差异 |
| 负反馈后推荐变化 | 次日同类课程从推荐中消失,替代课程与能力图谱逻辑一致 | 次日无变化,仍推同类课程 | 不支持负反馈功能 |
| 岗位模型修改后响应 | 保存后刷新即有调整,约10分钟生效 | 需手动“重新生成推荐”,且未说明生效窗口 | 需管理员手动调整课程绑定关系 |
| 绩效信号接入能力 | 展示已有接口和映射配置页面,技术方案清晰 | 表示“规划中” | 不支持 |
| 推荐理由可追溯性 | 可展示能力维度匹配度百分比 | 仅展示“根据你的岗位推荐” | 无推荐理由 |
我想强调一点:测试表现不代表长期使用效果。POC 环境里的数据和真实生产环境的数据在规模、噪声和非稳态特征上都完全不同。测试的目的是筛选掉明显不合格的产品和明显夸大的宣传,但要真正验证一个系统的推荐引擎好不好,至少需要在真实环境中跑 6 个月,积累足够的员工学习行为和绩效变化数据之后才能做客观评价。
六、部署后的持续运营:90% 的企业都忽略的三件事
系统上线不是结束,而是真正的开始。但我观察到的情况是,绝大多数企业在培训模块上线后,运营动作只停留在两个层面:更新课程内容、导出学习报表。这两个动作都没错,但它们和“让推荐系统越用越准”之间没有任何直接关系。
基于我在五家企业做过培训系统持续运营跟踪的经验,真正对推荐效果产生长期影响的是下面三件事。
1. 建立“数据治理月会”机制
我在第二节提到过这个机制,这里展开讲具体怎么操作。
数据治理月会不是培训部门内部的会,而必须拉上 IT 和数据团队一起。会议频率每月一次,时长控制在 40 分钟以内,固定议程只有三项:
- 数据质量巡检(15分钟)。抽查上一月度新入职和岗位变动的员工,检查其岗位标签、能力标签是否完整准确。抽查比例建议不低于该两类人群的 10%。同时检查上月新增课程的标签标注是否完成。
- 推荐效果核心指标查看(10分钟)。不看过多的报表,只看三个数:推荐位点击率(CTR)、推荐课程完课率、员工负反馈率(如果系统支持的话)。三个数如果和上个月相比波动超过 20%,触发深入排查。
- 异常案例讨论(15分钟)。由培训部门提前准备 2-3 个“推荐明显不合理”的真实案例,带着案例和数据团队一起走查推荐链路,定位到底是数据问题、规则配置问题还是模型问题。
这个机制搭建起来不复杂,难在坚持。但坚持半年以上的企业,推荐准确率无一例外比上线初期有明显提升,这不是算法变好了,而是数据质量被持续纠正了。
2. 管理“课程生命周期”而不只是“课程内容”
培训部门传统上管课程,关注的是课程是不是最新版本、有没有过时内容。但在智能化推荐系统里,还需要管理课程的“推荐状态”,包括:
- 这门课当前在推荐池里的权重是多少?
- 它的主要推荐受众是哪些岗位、哪些能力短板?
- 它的绩效反馈数据是正向还是负向?
- 它是否进入了“推荐疲劳期”(即已经推给了所有目标学习者,完课率开始下降)?
我见过做得最好的一家金融科技企业,培训团队每季度会对课程库做一次“推荐价值重估”,产出非常简练的一条结论:保留、降权、下架、或者保留但更换推荐人群。这个工作不会超过半天,但它是维持推荐系统活力的核心动作。
3. 设置“人类安全阀”并定期测试
我在第四节里提过人工干预的重要性,这里补充两个实操建议:
- 划定推荐规则的“不可变区”。合规课程、安全培训等法定必修课,设为系统推荐的绝对白名单,无论算法怎么跑,这些课的推荐优先级永远最高且不可被自动降权。
- 每季度做一次“盲测”。找 5 个你熟悉的真实员工作为测试样本(可以是培训团队自己的成员),不提前查看推荐结果,让系统分别给他们生成推荐列表,然后由你基于对这些员工的了解手动打分,合理、可疑、完全不对。三个季度坚持下来,你可以画出一条推荐合理率的变化曲线,这比任何厂商给的准确率数字都更真实。

七、一个不能回避的伦理问题:AI 推荐会不会“歧视”员工?
写到这里,我必须处理一个在行业讨论中常常被回避但在真实落地中一定会碰到的问题:当培训推荐由 AI 决定时,会不会产生歧视性的结果?
这个问题不是杞人忧天。2023 年某国际人力资源科技论坛上公开了一组实验数据:在不施加任何公平性约束的情况下,基于历史数据训练的培训推荐模型,会将 45 岁以上员工的“可塑性”标签权重系统性压低,因为历史数据中年龄偏大员工参与非必修培训的比例本来就低,模型从数据中学到的不是“他们不需要培训”,而是“推荐给他们也不会学”。这就是统计歧视的经典路径:模型复制并放大了历史数据中已有的偏见。
在培训推荐场景中,歧视性偏差可能以以下几种形式出现:
- 岗位歧视。模型倾向于给管理岗推荐领导力课程,给一线操作岗只推荐技能合规课,不给一线员工任何向管理方向发展的学习路径。
- 性别偏差。在某些技术密集型岗位,女性员工的过往学习数据量较少,模型可能因此减少对女性员工的技术进阶课程推荐。
- 学习习惯歧视。偏好短视频学习的员工被大量推送碎片化内容,偏好长文阅读的员工被推送深度课程,两者之间的信息差距越拉越大。
目前行业里应对这个问题的方案主要有三个方向:
- 训练数据去偏。在模型训练前对历史数据做重采样或权重调整,确保不同群体被均衡代表。
- 公平性约束。在推荐模型的目标函数中加入公平性正则项,显式要求模型对不同人口学群体的推荐质量差异控制在一定范围内。
- 审计与透明度。定期按年龄、性别、岗位层级等维度分组统计推荐多样性指标和推荐接受率,一旦发现组间差异超过阈值就触发人工审查。
坦率地讲,目前在人事系统培训模块中系统化解决歧视问题的产品还非常少。大部分厂商把这个责任推给了“企业自行配置”,允许客户自己在后台设置“公平性规则”,但既不给默认配置也不给审计工具。
我的判断是:两年之内,AI 培训推荐的公平性审计会成为大型企业在选型时的刚性要求。不是因为这些企业更有社会责任感,而是因为一旦出现系统性的培训资源分配不公导致的劳动争议或者人才流失,算法黑箱不会成为企业的保护伞,不管企业说自己“不知道算法怎么运作的”,责任仍然是企业的。
给正在选型和已经在用 AI 培训推荐的企业三条行动建议:
- 在采购合同中加入“算法公平性审计”条款,要求厂商每年提供一次按人口学维度分组的推荐质量报告;
- 企业内部建立伦理审查机制,培训部门联合法务、合规和 DEI(多元化、公平与包容)团队,每半年复核一次推荐系统的投放均衡性;
- 对员工开放推荐规则的知情权,不是说要给每个员工看代码,但至少应该让员工知道“系统是根据什么给我推荐这门课的”,并且有渠道对不合理的推荐提出质疑。

八、结论:看懂规则不是为了崇拜算法,而是为了对推荐结果保持清醒的判断力
回到开头那个智能硬件公司的案例。
后来我们再去看他们的推荐系统配置页面,发现了六个问题:岗位能力模型三年没更新、课程标签只用“初级中级高级”做了粗线条标注、负反馈功能没有开启、绩效数据从未接入推荐模型、推荐位从来没有做过探索性投放、也没有任何人关心过推荐规则的变更日志。系统上线两年,推荐引擎在技术上确实迭代了一次,从第一代升级到了第二代,但数据层的六个问题一个没解决,推荐准确率从最初的 41% 缓慢跌到了 31%,还不如一个教务专员手动排课来得准。
我在帮他们完成一轮数据治理之后提了一个很直接的建议:在未来 12 个月内,不要追求推荐算法的升级,先把六项输入参数的质量从“能用”提升到“可靠”。他们接受了这个建议。六个月后回访时,数据治理带来的推荐准确率提升(从 31% 到 44%)远超过去两年算法升级的效果。
这件事让我更加确认一个判断:培训推荐系统的天花板,不在算法层,在数据层和制度层。
写这篇文章的目的不是让你成为算法专家,而是让你在下次打开公司培训系统后台、或者在选型会上听厂商介绍“智能推荐”时,心里有一张清晰的评估框架。你知道该看什么、该问什么、该怀疑什么。
如果你只从这篇文章里带走一句话,我希望是这一句:不要问“这个系统能不能智能推荐”,要问“它的推荐规则是我能看懂、能修改、能审计的吗”。
能回答好这个问题的系统,才有资格被叫做智能。回答不了的,无论演示界面上弹出多少酷炫的推荐卡片,本质上都只是一套长得好看的 if-then 规则编辑器。
接下来你可以做的事很具体:下周找半天时间,带着这篇文章里的六项参数清单和三步压力测试方案,把你正在用的或者正在选的培训系统跑一遍。不用等预算批准,不用等下一个采购周期。搞清楚你现在处于哪个代际、数据质量在什么水位、推荐规则对你来说是透明的还是黑箱的,这三个问题的答案,决定了你未来三年在培训数字化上是“越用越聪明”,还是“越用越添堵”。
常见问题解答(FAQ)
1. 为什么AI推荐给我的课程总是“不对味”?
我们公司刚上线了一套AI人事系统,培训模块会自动给每个员工推荐课程。可我收到的推荐里,居然有面向产品经理的进阶课,而我明明是HR。系统是不是在瞎推荐?这背后到底是数据出了问题,还是算法本身就有缺陷?
这个问题我遇到过不止一次。几年前我主导一家500强企业的LMS选型,测试过三套主流系统,结果发现“不对味”的根本原因通常不是算法坏,而是数据脏。AI推荐规则的底层逻辑是“匹配”,但大多数企业连最基础的岗位胜任力模型都没建全,更别说员工能力画像了。
比如有的系统只抓取了员工的岗位标签(如“HR”),却忽略了部门、职级、历史培训记录、绩效短板等维度的数据。我曾用一套系统做对比测试:先用完整数据(包含培训完成率、360评估结果、晋升记录)跑推荐,匹配度达到73%;然后只用手动输入的岗位和学历字段,匹配度直接掉到31%。
所以,与其怪AI,不如先盘点你的数据资产,员工花名册、绩效数据、培训记录、任职资格标准,这些才是推荐的“燃料”。燃料不纯,燃料不足,输出的结果自然跑偏。真正的AI推荐应该基于多维权重动态计算,而不是简单的标签匹配。
下次遇到“不对味”,你可以让供应商提供一个“推荐解释”功能,看它给出推荐的理由是什么(比如“因该员工沟通能力评分低于岗位基准2分,推荐沟通进阶课程”),如果理由含混,大概率是伪智能。
2. 如何判断一个AI培训推荐系统是真智能还是假智能?
现在市面上的HR系统都说自己有AI推荐,但有的其实就是管理员手动给课程打几个标签,员工选什么标签就推什么课。作为HR,我怎么在招标或试用阶段,快速辨别它是真的机器学习驱动的推荐,还是只是给标签“套了层AI皮”?
这个问题几乎是所有HR选型时的盲区。我曾在一次项目中亲自拆解过某知名厂商的“智能推荐”模块,结果发现后台就是一个Excel表格:课程-标签映射表,员工-标签匹配表,完全靠人工维护。真智能和假智能的核心区别在于:规则是否动态迭代。
你可以用一个简单的“三问测试法”去拷问供应商:第一问,如果员工连续三次跳过推荐的一门课,系统会自动降低这门课的权重,还是依然每次必推?第二问,当公司战略从扩张变为降本,系统能否自动降低管理类课程权重,提高成本控制类课程推荐?
第三问,给我看推荐系统的“反馈闭环”,员工学习后的行为数据(如考试通过率、绩效变化)是否反过来调整了推荐模型?真智能系统会明确回答“我们用用户行为反馈来调整模型参数,例如点击率低的课程会进入冷启动淘汰池”;假智能系统则只会说“我们根据岗位标签推荐,很灵活”。
另外,你可以要求查看系统后台的“推荐日志”,记录每次推荐的权重分配和计算依据。如果对方提供不了,要么是技术不透明,要么根本就是手动配置。我在一次POC测试中,故意给一个“智能推荐”系统喂了大量错误数据(比如把销售岗标成财务岗),结果推荐结果毫无变化,说明它根本没用数据自学习,直接pass。
3. 员工数据隐私与AI培训推荐冲突吗?合规边界到底在哪里?
最近公司想用AI给员工做个性化培训推荐,但员工担心自己的绩效、360评估、甚至考勤数据会被用来“监控”和“另作他用”。我也拿不准,《个人信息保护法》下,这些员工数据到底能不能给AI用?用了之后怎么保证不被滥用?
这个问题我研究了很久,也亲自参与过一家上市公司合规体系的设计。先说结论:完全不冲突,但需要合规设计。根据《个保法》第13条,企业为“人力资源管理所必需”而处理员工数据,是可以的。培训推荐属于典型的人力资源管理范畴,所以用员工岗位、绩效、培训记录来训练推荐模型在法律上是站得住脚的。
但关键要满足三点:第一,必须告知员工数据处理的目的、方式、范围,并且取得明确的知情同意(通常嵌入劳动合同或HR系统用户协议中);第二,数据只能用于培训推荐,不能跨界给薪酬、晋升、裁员等场景;第三,AI模型不能基于敏感个人信息(如性取向、宗教信仰)做推荐。
我踩过的坑是:某系统默认把员工在职年限作为重要推荐权重,结果老员工总是被推基础课,引发年龄歧视投诉。后来我们构建了“合规审计清单”:列出每个数据字段的合规等级(必选/可选/禁用),并设置算法公平性检测(比如检查同一岗位不同性别的员工收到的推荐课程分布是否显著差异)。
对于员工最担心的“监控”问题,可以设计“培训隐私仪表盘”,让员工看到系统记录了哪些数据、推荐依据是什么,并且提供申诉渠道。合规不是束缚,而是赢得员工信任的前提。
4. AI推荐的课程员工学完后绩效没提升,问题出在哪儿?
我们花了几个月上线了AI培训推荐系统,系统根据绩效差距给销售团队推了一系列话术课程。但两个月后的业绩复盘发现,销售额几乎没有变化。是推荐规则不准?课程内容太水?还是执行出了问题?作为培训负责人,我该怎么系统化排查?
这是我亲身经历的一课。当时我们给一家电商公司的客服团队推AI推荐课程,聚焦“投诉处理技巧”,结果3个月后客诉率只降了2%,远低于预期。我和数据分析师一起做了全链路诊断,发现了一个令人震惊的事实:推荐模型中“绩效差距分析”给出的结论是客服“共情能力弱”,于是推荐了共情类课程;
但实际分析录音发现,客服的主要问题是“产品知识不熟”和“系统操作延迟”,而非共情。也就是说,推荐规则的输入,绩效差距分析本身是错的!所以第一步,要排查“诊断逻辑”:系统用什么指标定义绩效差距?是用客服满意度评分?还是客诉处理时长?还是360评价?如果数据源单一或指标有偏,那推荐出发点就歪了。
第二步,排查课程质量:我们当时发现推的课程是由第三方供应商提供的,内容全是理论模型,缺乏真人实景案例,员工看完“听过就忘”。后来我们把课程换成公司内部优秀录音拆解+模拟练习,效果立竿见影。第三步,排查执行环境:很多企业忽略了“学习转化”环节,员工学完后,有没有主管的跟进辅导?
有没有在周会上分享落地案例?我们做了一个对照实验:A组只推送课程;B组推送课程+每两周强制小组复盘。结果B组的绩效提升率是A组的3.2倍。所以,AI推荐只是第一步,完整的“培训效果闭环”需要匹配课程内容生态、管理支持、激励机制。
我给所有HR的建议是:不要迷信推荐算法,要把它当成一个“诊断+推荐+追踪”三联系统中的一环,缺一不可。
核心关键词
原创文章,作者:ihr360,如若转载,请注明出处:https://www.ihr360.com/hrbaike/20260721184274/.html
读者评论
作为甲方HR,这篇文章戳中了我的痛处。我们公司去年上线了一套号称AI推荐的人事系统,结果员工普遍反馈推荐的课程和实际工作脱节。看完文章才明白,问题不在算法,而在我们连最基础的岗位能力模型都没对齐,导致系统一直在推无效内容。文章提到的数据治理月会建议非常有实操价值,我决定下周就推动IT和培训组建立这个机制。
我是负责海外业务的VP,文中提到的“推《高效能人士的七个习惯》给被投诉沟通不专业的团队”简直就是我们公司的翻版。我需要的不是泛泛的管理课,而是针对跨文化沟通的具体解决方案。这篇文章让我理解了背后的原因,是标签体系没有反向映射绩效信号。我现在知道该怎么跟HRD沟通了,不能只看培训指标,要看业务痛点。
作为培训专员,我一直觉得公司的智能推荐不太“智能”,但说不出问题在哪。文章用代际划分和数据参数详细拆解了三类推荐模式,尤其那个岗位重合度40%的例子让我恍然大悟,同一个岗位名称在不同地区能力要求差异巨大。我打算拿着这篇文章去跟IT部门协商,先检查我们系统里有没有做标签对齐。
我是IT部门的系统管理员,负责维护人事系统。文章说大多数系统的所谓智能推荐只是三层过滤,我对照我们用的系统确实如此。最震撼的是那句“没有绩效反馈回路的推荐系统只能预测你会点什么,不能预测什么对你真正有用”。我准备跟供应商确认一下他们的动态参数更新机制,如果一直没做反向映射,那就别怪业务说推荐不准了。
作为一家HR SaaS厂商的产品经理,这篇文章让我有点脸红但更多的是收获。作者对三个代际的划分虽然是基于调研,但确实反映了行业现状。我们目前产品处于第二代向第三代过渡阶段,最大的瓶颈是客户不愿意提供绩效数据做关联回算。文章提到的“数据治理是最前置条件”点醒了我,与其在算法上堆功能,不如帮客户先把标签体系和更新频率规范起来。