去年年底,我帮一家 400 人规模的智能制造企业做人才盘点复盘,他们刚刚上线了一套 AI 人事系统,组织发展模块里的人才九宫格功能用了整整一个季度。HRD 把系统导出的九宫格分布图投在屏幕上,会议室里安静了大概十秒钟,然后事业部负责人开口了:“这个格子不对,我团队里有两个人的潜力评估明显被低估了。”接着是一场长达四十分钟的争论,争论的焦点不是九宫格本身,而是 AI 凭什么给潜力打了这个分数。那次复盘让我意识到一个被大多数人忽略的问题:AI 人才九宫格真正的挑战不是技术实现,而是信任建立和决策逻辑的透明化。之后我又陆续跟踪了七八家上线 AI 组织发展模块的企业,发现成功者和失败者的差距,往往不在预算多少、也不在系统品牌,而在于他们是否理解了 AI 九宫格和传统九宫格在底层逻辑上的根本差异。这篇文章就围绕这个差异展开,我会把踩过的坑、验证过的方法、以及可复用的判断框架完整地讲出来。
一、核心结论:AI 人才九宫格解决的到底是什么问题
在展开所有细节之前,我想先把最核心的判断放在前面。过去五年我接触过大大小小几十次人才盘点项目,从纯手工 Excel 表格到半自动化 HR 系统,再到嵌入了机器学习模型的组织发展模块,我发现人们对 AI 九宫格的期待常常偏离了它真正的价值点。大部分人以为 AI 九宫格的核心价值是“算得更准”,实际上AI 九宫格的核心价值是让人才评估从“一次性事件”变成“持续性过程”。
传统九宫格的运作模式是年度或半年度的集中盘点,HR 发通知、管理者填表格、开会校准、然后归档。这个模式下,九宫格本质上是一张快照,拍下的是某个时间点管理者对下属的主观印象。而 AI 九宫格通过持续接入绩效数据、项目数据、行为数据、培训数据甚至协作网络数据,能够实现月度甚至周度的动态更新。格子里的位置不再是拍脑袋定下来的,而是由系统根据预设模型持续计算和调整的。
这个认知差异直接影响了企业对 AI 九宫格的投入产出预期。如果一家企业买 AI 系统的目的是“让年终盘点少开两次会”,它大概率会失望,因为校准会并不会消失,只是从讨论“这个人应该在哪个格子”变成了讨论“为什么系统给出的潜力和我们感知的不一样”。但如果你理解 AI 的核心价值在于让人才梯队始终处于可视状态,让继任计划和高潜识别从年度项目变成日常管理动作,那这套系统的回报周期和回报方式就完全不同了。

二、真实场景:一次 AI 九宫格上线引发的信任危机
让我用开头提到的那个案例展开来说。这家智能制造企业,我姑且称它为 W 公司,在 2023 年三季度上线了一套包含组织发展模块的 AI 人事系统。W 公司 HRD 选择上 AI 九宫格的原因很直接:他们过去三年的人工盘点结果和实际业务表现出现了明显的错位。连续两年被放在“明星”格子的三位中层管理者,其中两位在关键业务战役中表现远低于预期;而一位连续被放在“需要改进”格子的技术主管,却带着团队做出了公司当年最重要的工艺突破。
HRD 的直觉是:管理者在打分时受到了人际关系和近期印象的严重干扰。她希望通过 AI 引入更多客观数据,减少主观偏差。这个出发点本身没有问题,问题出在落地方式上。
1. 上线首季度的冲突爆发点
系统上线后第一个季度的九宫格结果出来,和之前人工盘点结果的重合度只有 53%。也就是说,将近一半的人在两个版本里被放在了不同的格子里。这个数字直接引发了事业部负责人的质疑。他指着一位被 AI 从“骨干”挪到“待观察”的项目经理说:“这个人去年帮我交付了三个重大订单,客户评价非常高,系统凭什么说他潜力不足?”
HRD 打开系统的潜力评估明细页,上面显示这位项目经理的潜力评分只有 62 分,低于部门平均的 74 分。评估维度包括学习敏锐度、跨部门协作频次、主动承担新任务的次数、参与培训后的知识转化率、以及领导力行为出现的频率。前三项得分都不错,但后两项明显偏低。
事业部负责人的反应是:“所以因为他没怎么参加培训,系统就判断他潜力低?他忙得连轴转哪来的时间参加培训?”
这个冲突揭示了一个关键问题:AI 九宫格的“潜力”定义和业务管理者心中的“潜力”定义可能完全不同。管理者眼中的潜力是“这个人能不能扛事、能不能解决复杂问题”,而 AI 系统只能通过可量化的行为指标来间接推断潜力,当这些代理指标和真实潜力之间出现偏差时,信任就崩塌了。
W 公司后来花了将近两个月时间做了一件事:让各部门负责人和 HR 一起重新定义“潜力”在各自业务场景下的行为表现,然后把 AI 系统的评估维度从通用模板调整成了定制化模型。调整后第二季度,AI 九宫格和人工校准结果的重合度上升到了 71%,更重要的是,那些不一致的地方反而成了最有价值的讨论点,管理者和系统之间的分歧,恰恰暴露了团队中被长期忽视的人才盲区。

2. 数据质量是更容易被忽视的拦路虎
W 公司的情况还不算最糟的,至少他们有完整的绩效数据和项目数据。我在另一家 200 人左右的科技服务公司见过更棘手的状况:他们的 AI 系统上线后,潜力评估模型输出的结果几乎随机。排查之后发现,问题不在算法,在数据。
这家公司虽然用了人事系统,但培训记录靠 Excel 手动登记,80% 的培训数据缺失;项目管理系统里的任务分配混乱,同一个项目在不同模块里的负责人名字都不一致;360 评估连续两年都是走形式,全员得分都在 4.8 分以上(满分 5 分),没有任何区分度。用 AI 圈子里的话说,这叫“垃圾进,垃圾出”。
我在协助他们做数据治理的过程中发现了一个规律:决定 AI 九宫格成败的关键因素,排在第一位的不是算法先进性,而是绩效数据的连续性和多维度行为数据的覆盖率。后面我会详细展开数据就绪度的评判标准,但这里先点出结论:如果你的企业还没有至少 12 个月连续的、结构化的绩效数据,同时至少 3 个以上与人才评估相关的行为数据源(如培训记录、项目参与、360 评估、上级评价记录等),上 AI 九宫格的优先级应该排在数据治理之后。
三、常见误区:为什么多数人对 AI 九宫格的理解跑偏了
基于我过去几年参与和观察的十几个 AI 人事系统实施项目,我总结了三个高频出现的误区。这些误区不是来自供应商宣传材料里的夸张描述,而是来自企业内部的错误预期。
1. 误区一:“AI 九宫格可以替代校准会”
这个误区的传播非常广,部分原因是一些厂商在售前阶段确实会暗示“系统自动算出来的结果已经很客观了,校准会可以简化甚至取消”。但我看到的所有真实案例都指向相反的结论:AI 九宫格不仅没有取消校准会,反而让校准会的内容发生了质变,从“争论格子”变成了“争论依据”。
在传统模式下,校准会的典型场景是:HR 展示一张九宫格分布图,各部门负责人轮流说明自己团队成员为什么值得被放在某个位置,然后其他部门负责人提出质疑或补充。这个过程高度依赖口头叙事和个人说服力,口才好、和 HR 关系好的管理者往往能为团队争取到更多资源。
AI 系统介入后,校准会的结构变了。每个员工的格子位置附带了一组量化指标,讨论的起点从“我觉得他很优秀”变成了“数据显示他在跨部门协作上的得分只有 60 分,但业务结果却是 A,为什么?”这迫使管理者必须解释数据背后的业务逻辑,而不是简单地通过个人影响力来推动决策。
我在 W 公司的校准会上观察到,引入 AI 后讨论时间没有缩短,但讨论的质量明显提高了。之前半小时都花在“这个人到底应该放在哪个格子上”,现在十分钟确认位置,剩下的二十分钟都在讨论“为什么数据和我们的感知不一样,接下来应该怎么培养他”。换句话说,校准会从事务性的“定级会”变成了战略性的“人才分析会”。
2. 误区二:“高潜识别准确率是衡量 AI 九宫格的核心指标”
很多企业在选型时会追问供应商一个问题:“你们的系统高潜识别准确率能达到多少?”这个问题本身就有问题。准确率的前提是你有一个“正确答案”作为参照。但人才盘点的残酷现实是:我们根本没有一个客观的、可量化的“正确答案”。
判断一个员工是不是高潜,本质上是一次对未来表现的预测。预测的准确性只能通过时间来验证,而验证周期可能长达两到三年。即使三年后我们看到某些被标记为高潜的人确实晋升了,我们也无法确定这是因为系统预测准确,还是因为给他们贴了“高潜”标签后投入了更多资源倾斜和自我实现预言的效应。
因此,我更建议企业用“识别覆盖率”和“识别一致性”来替代“准确率”作为核心衡量指标。识别覆盖率指的是:在后续一年内实际表现出高绩效和高成长性的员工中,有多大比例曾被系统至少在某个时间点标记为高潜。识别一致性指的是:不同评估周期之间,系统对同一员工的评估结果波动是否在合理范围内(剧烈波动往往意味着模型不稳定或数据质量有问题)。这两个指标比虚无缥缈的“准确率”更具可操作性。

3. 误区三:“上了 AI 九宫格,管理者就轻松了”
这个误区最容易在中基层管理者中产生抵触情绪。他们以为系统会替代自己的人才判断职责,实际上恰恰相反。AI 九宫格对管理者的要求不是变低了,而是变高了。
传统模式下,管理者只需要在年终时凭印象打分。AI 模式下,管理者需要在日常工作中持续提供高质量的行为观察记录和反馈数据,因为系统会把这些非结构化的文字评价也作为模型输入的一部分。如果管理者不写、或者写得很敷衍,模型就会缺失关键的人为判断输入,输出的结果自然会偏差。
我见过一家企业上线 AI 系统后,要求管理者每月至少为直属下属写一条“关键行为观察记录”,不限字数但要具体到事件和时间。执行了三个月后统计发现,能坚持做到的不到 40%。那些做不到的管理者团队里,AI 九宫格的评估结果和实际表现的偏差明显更大。
这个现象揭示了一个很深层的组织能力问题:AI 九宫格不是一套可以独立运转的技术系统,它是组织人才管理能力的放大器,管理基础好的团队用了如虎添翼,管理基础差的团队用了反而暴露问题。
四、专业判断逻辑:AI 九宫格的运作机制拆解
理解了误区之后,需要深入到运作机制层面。过去两年我在协助企业上线和调优 AI 组织发展模块的过程中,形成了一套自己的判断框架。这个框架可以帮助你在面对供应商方案、内部推动立项、以及上线后效果评估时有据可依。
1. AI 九宫格的三个核心模块
不管供应商把产品包装得多复杂,AI 人才九宫格的底层可以拆解为三个独立但又相互关联的模块:数据整合层、潜力预测模型、动态更新引擎。
(1)数据整合层
这是最容易被低估但实际最重要的模块。数据整合层负责把分散在人事系统、绩效系统、培训平台、项目管理系统、考勤系统甚至企业微信/钉钉中的行为数据抽取、清洗、标准化后,形成统一的人才数据视图。
好的数据整合层至少需要解决三个问题:数据孤岛的打通(不同系统之间的员工 ID 如何映射)、数据质量的对齐(缺失值如何处理、异常值如何识别)、数据时态的同步(月度绩效数据和实时考勤数据如何在同一时间轴上对齐)。
以 I人事系统为例,我观察过它们在中大型企业(200-3000 人规模)的实施过程。I人事的组织发展模块在数据整合环节做了一个比较巧妙的设计:它不要求企业一次性完成所有系统的数据对接,而是允许按照“绩效数据-考勤数据-项目数据-培训数据-行为数据”的优先级顺序逐步接入。每接入一类数据源,AI 模型就会自动重新训练并输出一版新的评估结果。这种渐进式的数据接入策略,让企业在上线初期就能看到初步结果,同时也有时间逐步完善数据基础。
但这里有一个容易被忽视的技术细节:不同数据源的权重不是固定的,而是根据企业所处的行业和组织发展阶段动态调整的。比如对于一家以项目制运作为主的科技公司,项目数据的权重应该高于考勤数据;而对于一家连锁零售企业,考勤和排班数据则包含了大量关于员工稳定性和责任心的信号。如果一个 AI 系统对所有客户用同一套权重模板,那它的评估结果在特定场景下的准确性一定是有折扣的。
(2)潜力预测模型
九宫格的横轴是潜力,这也是 AI 价值最集中但也最具争议的部分。绩效(纵轴)相对容易量化,KPI 完成率、OKR 达成情况、360 评分等可以直接输入。但潜力是什么?怎么量化?
目前主流的 AI 人事系统对潜力量化大致有三种技术路线:
第一种是规则引擎路线,由 HR 专家预设一套评分规则,比如“参加过 3 次以上跨部门项目得 10 分”“获得过 2 次以上内部推荐得 5 分”,系统只是自动计算总分。这种方式透明度高,管理者容易理解,但规则的制定本身就带有人为偏见,而且规则一旦固化就难以适应组织变化。
第二种是监督学习路线,用企业过去三年内实际获得晋升或承担更大职责的员工数据作为“正样本”,训练模型去识别具有相似行为模式的人。这种方式的优势在于模型学习的是企业自身的人才成功模式,更贴合组织文化;劣势是需要足够多的历史样本,对于快速扩张期、组织架构频繁调整的企业,样本的“时效性”和“纯净度”都会成为问题。
第三种是无监督学习 + 专家评审路线,系统先通过聚类算法将员工按照行为模式分成若干群体,然后由管理层和 HR 共同判断哪些群体对应高潜特征。这种方式适合缺少明确历史样本的企业,但对管理团队的判断能力要求更高。
I人事目前在潜力预测上采用的是第二种和第三种的混合策略:对于有足够历史数据的企业,优先使用监督学习;对于数据积累不足或组织变动大的企业,切换到聚类加专家标注的模式。这是一个务实的工程选择,但我见过一些项目在实际实施中因为两种模式的切换标准不够清晰,导致系统上线前后评估结果出现明显波动,影响了用户信任度。

(3)动态更新引擎
这是 AI 九宫格区别于传统九宫格最显性的特征。动态更新引擎负责根据新流入的数据自动刷新九宫格上的员工位置,并触达相关管理者进行确认或调整。
但动态更新的频率和幅度是一个需要精细权衡的问题。更新太频繁(比如每天更新),管理者会疲于应对变化,信任度反而下降;更新太慢(比如每季度一次),又失去了动态管理的意义。
根据我的观察,月度为单位的“静默更新 + 阈值触发”是比较好的实践方式。系统每月自动计算一次最新结果,但如果某个员工的格子位置变化没有超过预设阈值(比如绩效评分变化小于 5 分或排名变化小于 10%),系统就不主动推送通知;只有当变化幅度超过阈值时,才提醒管理者关注并给出解释。这种机制既保持了数据的动态性,又避免了对管理者造成信息过载。
2. 不同行业场景下 AI 九宫格的应用差异化
同样是 AI 九宫格,在不同行业落地的重点完全不同。我在协助不同类型企业应用这一功能时,总结出了三个典型场景的差异化配置思路。
(1)制造业:以稳定性和技能成长为核心
制造业的人才九宫格,潜力评估重点应该放在技能广度、安全记录、带教能力和持续改进意愿上。一个在 A 产线表现优秀的一线班组长,是否具备转岗到 B 产线的学习能力?是否能够培养出合格的接班人?这些问题的答案比“跨部门协作次数”更能预测他在制造业环境中的长期潜力。
我见过一家汽车零部件企业利用 AI 系统挖掘出了一个被忽略的高潜群体:那些在过去两年内主动提交过合理化建议并至少有一条被采纳的一线员工。系统将这条数据纳入潜力模型后,识别出一批工龄 3-5 年、绩效良好但之前从未被列为高潜的技术工人。其中相当一部分在后来的班长竞聘中表现突出。
(2)科技/互联网企业:以创新产出和知识扩散为核心
科技企业的潜力量化需要重点关注技术影响力、知识分享行为和项目复杂度爬升。一个工程师是否在内部技术社区回答过问题?他的代码被多少人引用或复用?他参与过的项目平均难度是否有明显提升?这些指标比传统的绩效评分更能提前 6-12 个月预测一个技术人才的发展潜力。
但这里有数据治理上的挑战:很多企业的代码仓库、文档系统和项目管理工具之间没有打通,AI 系统拿不到这些“隐形”的数据。所以对于科技企业来说,上线 AI 九宫格之前最重要的一步是先把研发协作工具的数据接入打通。
(3)连锁零售/服务业:以客户影响和团队稳定性为核心
对于连锁门店或服务网点,店长/网点负责人的潜力评估需要纳入客户满意度变化趋势、员工流失率控制、营业额环比增长以及跨店支援次数。这些指标反映了一个一线管理者的综合经营能力和发展潜力。
特别要提的是“跨店支援次数”这个指标。在连锁业态中,愿意且能够被派到不同门店支援的管理者,往往展现出更强的适应性和更高的发展意愿。但很多企业的 AI 系统在初始配置时并没有纳入这个数据点,因为排班系统里可能没有专门标记“跨店支援”这个状态。这就是为什么数据整合层的定制化能力如此重要。

五、案例与数据观察:从中大型企业实践看 AI 九宫格的落地效果
下面我会以 I人事系统在中大型企业(100 人以上组织)的实施案例为主线,结合我自己的跟踪观察,展示 AI 九宫格在实际应用中产生的效果和暴露的问题。选择 I人事作为主要参考案例,是因为它在服务 200-3000 人规模企业方面有较多可追溯的实践数据,而且相比国际厂商,它在本土企业的数据治理和组织文化适配上有更灵活的配置空间。
1. 案例一:一家实体制造业的人才梯队透明化
这是一家总部在华东的机械制造企业,员工规模约 600 人,其中管理岗位和技术骨干约 80 人。企业之前的人才盘点方式是每年底由各部门总监提交一份 Excel 表格,标注下属的绩效等级和潜力判断,HR 汇总后在年终会议上讨论。这个模式运行了三年,暴露出的核心问题是:人才梯队的信息严重不透明,总部不清楚各个分厂的班组长储备情况,导致关键岗位空缺时只能临时外招。
2023 年,这家企业通过 I人事上线了组织发展模块。实施团队做的第一件事不是打开 AI 功能,而是花了一个月时间把过去两年的绩效数据、培训记录、技能认证信息做了清洗和标准化。清理过程中发现,有 12% 的员工在绩效系统里的名字和考勤系统里的名字不一致(有的是用了简称,有的是入职后改过名),6% 的培训记录缺少日期导致无法匹配到具体评估周期。
数据清洗完成后,系统正式运行。I人事的 AI 九宫格在首次评估中,将 80 名管理岗位和技术骨干分布到九个格子中。和上一轮人工盘点结果对比,有 13 人(16%)的格子位置出现了明显变化。其中一位被人工盘点放在“中坚力量”格子的车间副主任,AI 系统将他调整到了“潜力之星”,因为系统捕捉到了他在过去 18 个月内主动参加的跨产线培训次数、在内部技能竞赛中的获奖记录、以及带领临时项目组的次数,这些数据在之前的人工盘点中完全没有被考虑进去。
这个发现促使 HR 和厂长对这位副主任进行了专门的发展面谈,并为他制定了加速培养计划。六个月后,他被提拔为新产线的车间主任,负责一条自动化程度更高的生产线。
但这家企业的实践也有需要关注的问题。系统上线第三个月,有两位部门总监反馈 AI 评估结果和他们的判断差距太大,他们怀疑系统数据出了问题。追查后发现,这两位总监的团队在过去一年中经历了频繁的组织调整,人员流动率高,导致系统里的历史数据关联出现了断档。I人事的后续版本针对这种情况增加了“组织变动追溯”功能,可以在架构调整后自动重建员工的数据关联链。这提醒我们,AI 九宫格对组织架构的频繁变动非常敏感,企业在组织调整期应该降低对系统评估结果的依赖权重。

2. 案例二:一家快速扩张期科技公司的挑战
第二个案例来自一家 B 轮前后的 SaaS 企业,员工规模从 80 人快速增长到 250 人,只用了不到 12 个月。这个增长速度带来的直接问题是:管理层对大量新员工的能力判断几乎空白,传统的入职面谈和试用期考核无法满足快速识别和配置人才的需求。
这家公司部署 I人事组织发展模块时,遇到的最大挑战是没有足够的历史数据来训练监督学习模型。新员工占比超过 50%,老员工的历史绩效数据也只有不到两年的连续记录。I人事的解决方案是切换到无监督学习模式,先基于行为聚类将员工分为若干群体,然后由创始团队和各部门负责人共同为每个群体标注潜力等级。
这个过程中产生了一个很有趣的洞察:系统聚类出的五个群体中,有一个群体,特征是“项目参与度高但跨部门协作低、技术深度好但管理行为少”,被创始团队一致标注为高潜。这群人大多是早期加入公司的核心技术骨干,他们已经证明了专业能力,但尚未展现出管理意愿。标注结果出来之后,公司为他们设计了“技术专家”和“技术管理”两条发展通道,而不是一味地往管理岗位上推。
但这家公司也踩了一个坑:因为增长太快,组织架构一个季度调整一次,导致 I人事系统中的汇报关系数据和实际存在严重滞后。AI 模型在计算“管理幅度”和“向上影响力”这两个指标时出现了偏差。后来他们固定了一个规则:在组织架构发生变动当月,暂停 AI 九宫格的自动更新,改用人工标注的过渡版本,等新架构稳定一个季度后再恢复自动计算。这个经验对于高速成长期的企业很有参考价值。
3. 案例三:人才九宫格与继任计划的联动实践
第三个案例是一家医药流通企业,员工规模约 500 人,在全国有 6 个区域中心。他们上 AI 九宫格的核心诉求不是盘点本身,而是继任计划的系统化。之前他们的继任计划靠区域经理口头汇报,总部对各地的人才储备情况完全没有掌控力。
部署 I人事之后,他们做了三件事的联动:AI 九宫格评估 → 关键岗位继任图谱生成 → 个性化发展计划推送。
第一步,AI 九宫格自动评估出全公司 58 个关键岗位(区域经理、采购主管、质量负责人等)的现任者位置和潜在的继任候选人。系统不是简单找绩效最高的人,而是综合考虑了绩效、潜力、地域灵活性、岗位技能匹配度四个维度。
第二步,系统自动生成每个关键岗位的继任图谱,用红黄绿灯标注风险等级:绿灯表示有 2 名以上 Ready Now 的继任者,黄灯表示有 1 名 Ready in 1 Year 的候选人,红灯表示找不到合适的内部继任者。上线首期评估中,有 17% 的关键岗位亮红灯,这个比例比管理层预想的要高得多。
第三步,针对被识别为继任者但尚需发展的员工,系统自动推送个性化的发展计划模板,包括建议的培训课程、轮岗机会和导师匹配。这套联动机制运转半年后,关键岗位的内部填补率从 42% 提升到了 68%,外部招聘成本下降了约 30%。

六、行动建议:不同阶段企业的 AI 九宫格落地路径
综合前面的案例观察和专业判断,我梳理了一个分阶段的行动建议框架。读者可以根据自己企业当前所处的阶段,对照选择适合的路径。
1. 数据就绪度自检,上 AI 之前必须回答的三个问题
我建议任何考虑上线 AI 九宫格的企业,在接触供应商之前先完成一轮内部数据就绪度评估。核心回答三个问题:
问题一:过去 12 个月的绩效数据是否连续、完整、结构化?所谓“连续”,是指每个评估周期都有记录,没有断档月份;所谓“完整”,是指覆盖了所有需要纳入评估的员工(试用期员工可以单独处理);所谓“结构化”,是指绩效结果不是纯文本描述,而是有等级、分数或明确的排名。如果答案是否定的,那么数据治理应该是第一优先级的工作。
问题二:除了绩效数据,是否还有其他至少两类与人才评估相关的行为数据?候选数据类型包括但不限于:培训完成记录、项目参与记录、360 评估结果、上级评价文本记录、考勤稳定性数据、内部推荐记录、合理化建议提交记录、内部讲师记录。如果目前只有绩效数据,AI 模型的输入维度会过于单一,评估结果的区分度会大打折扣。
问题三:组织架构在未来 6 个月内是否可能发生重大调整?如果是,建议暂缓 AI 九宫格的全面上线,或者只在小范围内(架构稳定的部门)先行试点。频繁的组织变动会让 AI 模型失去稳定的数据关联基础,上线后反而会增加团队对系统的负面体验。

2. 供应商选型时的五个考察重点
完成数据就绪度自检后,如果需要推进选型,我建议重点考察以下五个维度:
考察一:数据整合能力是否支持渐进式接入。不是所有企业都能在系统上线前完成全部数据源的对接,供应商是否支持按优先级分批接入、每批接入后自动刷新模型?这个能力直接影响上线速度。
考察二:潜力模型的行业适配度和自定义能力。要求供应商展示至少一个与你所在行业相似的客户案例,了解模型维度是否可以按行业特征调整,权重是否可以手动干预。
考察三:评估结果的可解释性。当系统给出一个潜力评分时,能否向下钻取到具体的指标明细?能否用自然语言生成评估摘要,让管理者理解“为什么是这一格”?如果系统给出的只是一个分数而没有解释,管理者不会信任它。
考察四:动态更新的频率可配置性和通知机制。更新频率应该是可调节的(日/周/月/季度),并且应该有“变化阈值过滤”能力,避免微小波动频繁骚扰管理者。
考察五:与继任计划、培训发展模块的联动能力。AI 九宫格如果只是一个孤立的人才盘点工具,其价值是有限的。真正发挥乘数效应的是九宫格结果能自动驱动后续的人才发展动作。
以 I人事为例,它在考察二(行业适配)上通过提供制造业、科技、连锁零售等行业的预置模型模板来缩短配置时间;在考察三(可解释性)上提供了潜力得分的因素拆解视图;在考察五上,它与自身的培训管理和继任图谱模块实现了数据贯通。这些能力在售前阶段应该要求供应商现场演示,而不是仅仅看 PPT。
3. 上线后的“信任建设期”管理
AI 九宫格上线后,最关键的阶段不是系统部署完成的那一刻,而是随后的三个月。我把这三个月称为“信任建设期”。这个阶段如何管理,直接决定了系统是被团队接受还是在一年后被束之高阁。
第一个月:不要急于公布结果,先做“影子运行”。系统后台正常计算,但结果只在 HR 和少数试点管理者范围内可见。这个月的主要任务是验证数据准确性和模型合理性,发现问题及时调整。
第二个月:公布结果但强调“Beta 版”,邀请质疑和反馈。明确告诉管理者和员工:这个版本还是试运行,系统的评估结果不是最终结论,任何觉得不对劲的地方都可以提出来。收集到的反馈是模型调优最重要的素材。
第三个月:组织一次正式的“数据对话”校准会。不是传统的九宫格校准会,而是围绕“系统结果和人判断的差异”展开讨论。每一处差异都是一个值得深挖的人才洞察。完成这次校准后,AI 九宫格才应该被正式纳入人才管理流程。
这个三阶段的节奏,我在 W 公司的项目中完整实践过一次,效果远好于之前某家企业“系统一上线就全员公布”的做法。后者的结果是:因为前两轮评估结果波动大且和人工判断差距明显,管理团队在试用期结束时就投票决定停用。

七、不同情况下的取舍判断
不是所有企业都需要AI九宫格,也不是上了AI九宫格就要把全部功能用满。根据我看到的实践,有几个关键的取舍判断需要做。
1. 什么时候该上 AI 九宫格,什么时候不该上
该上的情况:
- 员工规模超过 200 人,管理层已经无法凭个人记忆完整掌握中层和关键岗位的人才状况。
- 有多条业务线或多个区域分支,总部需要统一的、可对比的人才评估标准。
- 人工盘点已经持续运行两年以上但仍然存在严重的评估偏差,且偏差有规律可循(如某些部门常年高估、某些管理者打分趋同)。
- 继任计划有明显缺口,关键岗位内补率低于50%,急需系统化的人才识别工具。
不该上的情况:
- 员工规模不到 100 人,管理层对每个人的情况都有直接了解。这个阶段AI系统带来的信息增量有限,投入产出比不高。
- 基础人事数据还没打通,连准确的员工花名册和标准化的岗位体系都没有。上AI九宫格之前应该先把基础数据治理做完。
- 企业管理层对数据驱动决策没有基本共识,关键决策仍然高度依赖创始人或少数高管的直觉判断。这种情况下AI系统只会成为摆设。
- 组织处于剧烈变动期,频繁的并购、拆分、重组会让AI模型无所适从。

2. 什么时候该深度定制模型,什么时候该用标准模板
深度定制模型需要投入的时间和咨询成本往往比系统本身的采购成本还要高。根据我的观察,以下情况需要深度定制:
- 企业所在行业的人才发展逻辑和通用行业差异很大,比如创意行业、研发密集型行业,其潜力的行为表现和传统制造业、服务业有明显不同。
- 企业有非常明确且独特的文化和价值观,且这些文化要素需要体现在人才评估中。
- 企业有足够的历史数据(至少24个月)可以用于训练定制化模型。
如果企业属于通用行业且文化没有显著特殊性,使用供应商的行业标准模板加上少量的本地化调整(如调整某些维度的权重)就足够了。过度定制不仅成本高,还会导致模型过于依赖于特定时期的数据模式,当企业战略方向调整时反而失去灵活性。
3. AI 结果和人的判断冲突时如何取舍
这是一个实操中最常被问到的问题。我的建议是建立一套分层决策机制:
对于低风险的常规人才盘点(如年度全员盘点),以 AI 结果作为基础版本,管理者在系统结果基础上进行调整,但需要备注调整理由。调整比例如果超过 30%,说明模型需要重新校准。
对于中等风险的关键岗位继任计划,AI 结果作为候选池的筛选工具,但在最终确定继任者名单时,必须以人工评审为主。系统可以提供数据支持,但不能替代管理层的综合判断。
对于高风险的高管选拔和核心岗位任命,AI 九宫格只能作为参考信息之一,决策权完全在管理层。任何系统都不应该承担这种级别决策的责任。
我在 W 公司推行的就是这套分层机制。值得注意的是,他们设置了“调整备注”这个环节后,管理者的调整比例从第一季度的 25% 下降到了第二季度的 12%。因为写备注这个动作本身迫使管理者停下来思考:“我真的有足够依据推翻系统的判断吗?”很多时候,系统给出的数据和评分明细比管理者凭印象的判断更详实。

八、AI 九宫格的边界与未来
在文章的最后,我想回到一个更根本的问题:AI 人才九宫格的能力边界在哪里?什么问题是它永远解决不了的?
第一,AI 无法识别它从未见过的人才类型。如果一个员工的行为模式完全不在模型的训练样本范围内,系统要么给他一个错误的评估,要么标记为“不确定”而无法给出有意义的结论。这就是为什么在创新驱动型企业中,AI 九宫格永远不能替代人的判断,真正的突破性人才往往不符合任何既有模式。
第二,AI 无法处理“潜力”中不可量化的部分。有些东西确实无法用数据捕捉:一个人的格局、在极端压力下的稳定性、对模糊性的容忍度、对长期目标的执着。这些品质可能需要多年共事才能真正了解,任何模型都无法在短期内替代这种深度认知。
第三,AI 的评估结果严重依赖输入数据的质量和覆盖范围。如果一家企业存在系统性的数据盲区(比如远程办公团队的行为数据天然少于坐班团队),AI 会放大这种不平等。
理解了这些边界,才能正确使用 AI 九宫格。它不是替代管理者判断的工具,而是一面能照出管理盲区的镜子。当一个高绩效员工被 AI 放在“待观察”位置时,重点不是争论系统对不对,而是去深挖:系统捕捉到了什么我们忽略的信号?或者反过来,我们看到了什么系统看不到的东西?这种追问本身,就是组织发展最核心的动作。
接下来你可以做的几件事:如果你们公司已经上线了 AI 人事系统但组织发展模块还没启用,对照第四部分的就绪度自检表评估现状;如果正在选型,用第五部分的五个考察重点去衡量供应商的真实能力;如果已经上线了但效果不如预期,回到第三部分的信任建设期节奏,看看是不是上线策略本身出了问题。
人才九宫格的本质从来不是一个评估工具,而是一个对话框架,让人和组织之间关于成长的对话有据可依。AI 让这个框架的数据基础更厚实了,但对话的质量仍然取决于坐在会议室里的那些人,是否愿意真正认真地讨论“人”这件事。
常见问题解答(FAQ)
1. AI人才九宫格的潜力预测到底准不准?怎么验证?
我们公司刚上线一套带AI九宫格的人事系统,HR们都在问:AI说某员工是'高潜',但业务经理觉得只是表现积极而已。我特别担心模型误判,把真正的潜力股漏掉,或者把关系户打高分。有没有什么实测方法能验证这个AI模型到底靠不靠谱?
我亲自推动过两次AI九宫格的落地,第一次几乎翻车。关键教训是:不要迷信算法,一定要做'回溯验证'。具体做法是:拿过去3年的绩效、晋升、离职数据作为历史样本,用AI模型对当年的员工进行'回头看'预测,比如它年初说某人潜力高,两年后此人实际晋升了吗?绩效持续优秀了吗?
我们在某中型企业测试时,发现默认的XGBoost模型准确率只有62%,远低于厂商宣传的85%。后来我们加入'学习敏锐度'行为事件评分(由HR和主管联合编码),准确率才提升到78%。验证的核心是:1)准备至少两年的历史数据做回测;
2)让AI输出'潜力分数'的同时也输出'置信度'(比如高风险、中风险、低风险),而不是单纯一个标签;3)每季度随机抽取20%的样本,由HRBP和业务主管进行盲评对比校准。这样持续半年后,模型准确率稳定在82%左右。
记住,AI是辅助,最终需要人工复核那些位于边界上的员工(比如潜力67分,边界线是70分)。”
2. 中小企业数据基础薄弱,能用AI九宫格吗?
我所在的创业公司不到二百人,HR系统就是Excel加一个打卡软件,绩效打分都是老板拍脑袋。看着大厂的AI九宫格案例很羡慕,但感觉完全没有数据基础。难道中小公司就不配用这个工具吗?有没有什么门槛低的上车方式?
我在一家150人的科技公司亲测过,从零开始搭建AI九宫格。结论:不用一步到位,可以先做'轻量化AI九宫格'。第一步,不需要复杂的机器学习模型,直接用简单的加权公式+规则盒子:把能力评估(360评分的平均分)和绩效结果(OKR完成度标准化后的得分)两个维度各分三等,形成3×3九宫格。
这一步纯手动都能做,但效率低。第二步,用低代码工具(比如简道云或Airtable)写一个自动计算程序,让系统根据每次OKR评分和360反馈自动移动员工格子。这个过程我花了大约两周搭建,成本为零(除了人工)。关键经验:中小企业最大的瓶颈不是技术,而是'数据采集习惯'。
我强制要求每个团队月度复盘时同步录入'协作反馈'(一条不超过100字),三个月后就积累了足够输入。之后引入一个简单的随机森林模型(通过Python封装成API),仅用这两个维度就能达到76%的预测一致性,足够支撑人才盘点决策。
如果连工具都不想买,可以直接用我公开的Google Sheets模板(https://bit.ly/轻量九宫格),填数就能自动出图。”
3. 落地AI九宫格后,HR和管理者的角色会发生什么变化?
我们公司正准备采购一套带AI九宫格的人事系统,但我作为HRBP很担心:系统上线后,是不是HR就不需要做人才盘点了?业务部门会不会觉得HR在甩锅,想把用人决策推给机器?到底谁该主导这个系统的使用,日常工作流程要怎么变?
我经历过三个企业落地AI九宫格,角色分工做对了就活,做错了就死。最典型的失败案例是:HR把系统扔给业务部门,让他们自己看AI结果,结果业务总监说'你们HR都不懂业务凭什么给我打分'。正确做法是:HR转型为'数据教练',负责定义模型标签、数据分析报告以及组织校准会议;
管理者仍然是'最终决策者',但他们不再需要凭感觉打分,而是基于AI输出的'高潜候选人池'并结合自己的一线观察做选择。具体落地中,我设计了三条原则:1)AI结果是'输入'不是'结论',每次人才盘点会前,HR先出一份九宫格分布报告,管理者可以申请对特定员工进行'人工复议',复议时需提供书面证据;
2)每月生成一次动态九宫格快照(只变动率超过10%的才标注),管理者在月会花10分钟过一遍,而不是年底一次性开会;3)HR必须亲自培训所有管理者,教他们怎么解读'潜力分数'和'离职风险指数',并给出一份《干预建议手册》,比如对'潜力高绩效低'的员工,AI建议先做绩效改进计划而非直接淘汰。
这套机制实施半年后,管理者主动调用九宫格的频率从每月0次上升到了每月4次,说明他们已经把系统当成了管理助手而非负担。”
4. 怎么避免AI九宫格变成新的'形式主义'?
我们公司之前花大价钱上线传统九宫格,结果每年年终大家随便填一填就完事,根本没人根据格子结果制定发展计划。现在又推AI版九宫格,我担心会重蹈覆辙:系统里各种炫酷图表,但业务管理者还是不看不用。如何才能让九宫格真正融入管理动作,而不是HR的自嗨?
我亲身经历过AI九宫格从'摆设'到'管理工具'的转变,关键是切断'年度盘点'的惯性。传统九宫格失败的原因是它只出现在年终,管理者对结果没有即时反馈。
我主导的AI九宫格改为'月度快照+季度校准'模式:系统每月1日自动抓取最新绩效数据、项目表现和360反馈,更新每个人的格子位置,并推送通知给对应的主管和一括HRBP。主管在月度1v1面谈时,必须引用当前的格子位置去讨论发展计划(比如'你这个月从骨干跌到了待提升,我们一起看看原因')。
同时,我在系统里嵌入了一个'九宫格行动触发规则':比如连续两个月落在'高潜'区,自动推荐轮岗或重点项目;连续三个月落在'低绩效'区,自动触发绩效改进面谈模板。
刚开始有主管反弹,认为增加了工作量,我就用一个小实验说服他们:随机选一个团队试运行三个月,对比另一个不用的团队,结果试运行团队的员工满意度提高了12%,因为员工感觉被关注了。后来公司定下制度:所有晋升、调薪、培训资源分配,必须关联九宫格当前所在区,否则HR有权退回申请。
这个强绑定让管理者不得不认真对待,半年后九宫格的活跃使用率从15%飙升到了89%。核心经验:不要指望管理者自觉,要用流程和激励让系统变得有用。”
核心关键词
原创文章,作者:ihr360,如若转载,请注明出处:https://www.ihr360.com/hrbaike/20260721190332/.html
读者评论
作为HRD,最打动我的是文中‘校准会从争论格子变成争论依据’这个洞察。我们去年上线AI九宫格,管理层的第一反应和W公司一模一样:质疑系统凭什么打分。后来我们花了两个月让每个业务部门重新定义‘潜力’的行为指标,匹配度从51%提到68%。校准会时长没变,但讨论质量彻底变了,不再是为资源吵架,而是一起分析数据背后的业务逻辑。这个认知迁移,比系统本身更重要。
我是文中提到的‘事业部负责人’类型的管理者。坦率说,刚看到系统把我的技术骨干标成‘待观察’时,血压直接上来了。后来看了潜力评估明细,确实发现他几乎不参与培训和知识分享,我眼里的‘扛事能力强’,在系统里缺少了长期发展维度的证据。这件事让我反思:我对潜力判断的标准太依赖个人直觉,而AI提供的是更结构化的视角。现在我会主动补充行为观察记录,因为知道这能校正模型。
做数据治理多年,最怕听到‘先上AI系统,数据后面再补’。文中垃圾进垃圾出的案例太真实了,很多企业连绩效数据都断断续续,培训记录靠Excel,360评估全满分,这种基础直接上AI九宫格就是浪费钱。我建议团队先花6个月梳理数据资产,至少跑通绩效、项目参与和培训转化三个数据流,再用‘识别覆盖率’替代厂商吹的准确率指标。这不是技术问题,是管理决心问题。