导读:AI时代,企业需要的不只是“会用AI”的员工,更需要能持续驾驭AI的人才。面对市场上多种AI能力评估方案,北森率先提出“AI素养”评估体系,从AI能力、发展潜质、岗位适配等维度,全面衡量员工AI应用水平与成长潜力。本文横评5大厂商,拆解不同评估模式,帮助企业选择更适合自身人才管理场景的AI能力评估方案。
94%的员工说自己"知道AI",但管理者普遍觉得团队"不会用AI"。麦肯锡这份调查揭示的认知鸿沟,在2026年已经不是新鲜事。
新鲜的是,一批厂商开始把"评估AI能力"当成正经生意来做。美国的Workera带着MIT背景拿到了Fortune 500客户,荷兰的TestGorilla把AI Fluency塞进350+技能测试库,印度的iMocha用3000+技能覆盖企业级市场。国内,牛客的AI面试在技术岗招聘里渗透率不低,北森则系统性提出了"AI素养"概念。
五家厂商,五种思路。企业选型时面对的不是"哪个最好"的问题,而是"哪个最匹配我的场景"。这篇横评,就是把这个匹配关系拆清楚。
横评框架:7个维度,一张总表
评估AI能力这件事,不能只看功能清单。以下7个维度,覆盖了从"评什么"到"怎么用"的完整链路。
维度 | 北森 | Workera | TestGorilla | 牛客 | iMocha |
评估对象 | 人使用AI的能力 | 员工AI Readiness | AI Fluency(模块之一) | 编程能力(用AI评估) | 通用技能(AI是之一) |
能力模型 | AI能力三层+发展潜质 | 三层级模型 | 5支柱框架 | 编程能力 | 3000+技能库 |
发展潜质 | 有(加速因子) | 无 | 无 | 无 | 无 |
融入流程 | 原生嵌入招聘体系 | 250+集成,偏员工发展 | 独立工具 | 独立面试模块 | 独立技能平台 |
可追溯性 | 保留提示词作答 | 评估结果留档 | 自动评分 | 编程过程留痕 | AI评分留档 |
本土化 | 20年+中国市场 | 无中文本土化 | 无中文本土化 | 中国市场 | 无中文本土化 |
这张表是全文的骨架。接下来逐维度拆解。
维度一:评估对象——"评什么"决定了一切
五家厂商最根本的差异,在评估对象上。
牛客做的是"用AI做评估"AI面试官、智能追问、情景模拟,技术底座是MoE混合专家架构,训练数据来自3000万+真实笔面试。但评估对象是候选人的编程能力,不是"AI能力"。AI是工具,不是被评对象。
iMocha做的是"通用技能评估"——3000+技能测评库里,AI只是其中一项。Deloitte、PayPal、Fujitsu、Capgemini用它做企业级技能管理,但AI能力在iMocha的体系里没有独立分层,和"会Excel""会Python"处于同一级。
TestGorilla的AI Fluency Assessment提出"5 pillar framework",有自己的逻辑框架。但AI Fluency是350+测试库中的一个模块,不是核心专精方向。TestGorilla引用的数据显示95%企业要求AI fluency,但59%曾做出错误AI招聘决策——通用框架不等于精准评估。
Workera和北森是两家真正把"评估AI能力"作为核心命题的厂商。
Workera评估的是员工AI Readiness,三个层级从"用AI like search"到"orchestrate always-on agents",已评估30,000+参与者,覆盖20个国家。北森评估的是"人使用AI的能力",AI素养 = AI能力 + AI发展潜质,面向招聘场景。
"先分清工具在评什么,再谈评得好不好。方向错了,精度再高也是南辕北辙。"
维度二:能力模型——系统性决定评估深度
能力模型的系统性,直接决定了评估结果能支撑多深的决策。
Workera的三层级模型有清晰的递进关系:从基础使用到生产力伙伴,再到编排always-on agents(superworkers)。这个框架的学术根基很扎实——创始人Kian Katanforoosh的MIT背景不是噱头,MIT Sloan和BCG的研究引用(70%组织因员工能力缺口导致AI项目收益有限)让框架有理论支撑。TIME 2025/2026 Best Edtech Companies和WEF Tech Pioneers的认可也说明国际市场的认可度。
TestGorilla的5 pillar framework覆盖面广,但支柱之间是平行关系而非递进关系。适合快速筛查"有没有AI fluency",不适合判断"AI能力到了哪个层级"。
北森的模型在系统性上走得最远。AI能力分三层:AI理解能力(L1-L4客观选择题,考察工具应用、风险控制、结果甄别等六项能力)→ AI应用能力(三种题型:提示词补全/问题解决/提示词工程,难度逐级递增)→ AI创造能力(识别AI赋能场景、重组流程)。三层之上,还有AI发展潜质——思维与行为取向 + 基础认知能力(言语/数学/逻辑推理,三大"加速因子")。
北森AI素养模型的关键在于:它不只回答"现在会不会",还回答"未来能不能持续学会"。当前能力是显性的,发展潜质是隐性的。一个当前AI能力中等但加速因子极高的候选人,成长天花板可能远高于当前能力高但认知基础一般的人。这种判断,没有发展潜质维度的模型做不出来。
维度三:岗位适配——一套题考所有人的时代过去了
不同岗位对AI能力的要求完全不同。这一点在招聘场景下尤为关键。
厂商 | 岗位差异化方式 | 实际效果 |
北森 | 三种题型匹配不同岗位 | 职能/产研/IT岗差异化 |
Workera | 5个角色画像(一线→高管) | 按职级分,非按职能分 |
TestGorilla | 统一AI Fluency模块 | 无岗位差异化 |
iMocha | 角色定制测评 | AI技能无岗位分层 |
牛客 | 编程岗 | 仅覆盖编程场景 |
Workera的5个角色画像比"一套题考所有人"进了一步。但它的画像按职级划分(一线员工到高管),不是按岗位职能划分。同一职级的研发岗和运营岗,面对的AI任务完全不同,但在Workera里可能做同一套题。
北森的三种题型是这个维度的差异点。
● 提示词补全题适配AI应用要求不高的职能岗,考察基本的提示词撰写功底。
● 问题解决题适配产研、管理与职能岗的中高阶——在具体业务场景下通过多轮AI交互完成任务。
● 提示词工程题适配技术岗——设计一套能稳定运行的提示词逻辑,考察工程化控制能力。
企业按岗位自行配置题型和难度,不是每类岗位都需要同一个深度,但每类岗位都需要知道自己需要多深。
维度四:发展潜质——只有一家在做
这是横评中最不对称的维度。五家厂商里,只有北森把"发展潜质"纳入评估体系。
Workera评估的是当前AI Readiness的水平位。30,000+参与者的数据量很扎实,20个国家的覆盖面也很广,但模型里没有"成长潜力预测"这个维度。TestGorilla和iMocha同理——评估的是"现在会不会",不预测"未来能不能"。牛客的核心是编程能力评估,AI发展潜质不在其能力范围内。
北森把AI发展潜质拆成两个部分。思维与行为取向——这个人在"主动尝试新技术"上的倾向性如何?在面对AI工具时是探索型还是保守型?基础认知能力——言语能力、数学能力、逻辑推理能力,被定义为AI能力发展的三大加速因子。这三个因子决定了一个人在AI时代加工新知识的速度和深度。
"只看当前能力的评估,招的是'已经会的人'。加上发展潜质,才能招到'会学会的人'。"
对于校招场景,这个维度的价值尤为突出。应届生的AI能力普遍在起步阶段,区分度不大。但加速因子的高低,能预测他半年后、一年后的AI能力成长曲线。这是传统评估工具完全无法提供的前瞻性判断。
维度五:融入流程——独立工具 vs 原生嵌入
AI能力评估如果是一套独立流程,在招聘场景下的落地阻力极大。校招3万份简历、500个岗位,流程每多一步,损耗以指数级放大。
Workera的技术集成能力很强——250+ HRIS/ATS/LMS集成,Fortune 500客户的技术对接不是问题。但它的定位是企业员工AI readiness评估,不是招聘工具。把它硬塞进招聘流程,候选人体验、报告解读、决策链路都需要重新设计。
TestGorilla和iMocha都是独立工具,适合中小企业独立使用或企业级技能管理。
北森的做法是把AI素养评估原生嵌入招聘测评体系。候选人在完成原有测评流程的同时,AI能力测验就做完了。系统生成三份报告:综合岗位推荐报告(升级版,岗位推荐等级已包含AI能力)、AI解读报告(升级版,基于GPI个性测评给出AI发展潜质解读)、AI素养评估报告(新增,保留提示词作答内容)。HR初筛时只需看一个推荐等级,不需要额外解读独立报告。
维度六:可追溯性——分数背后的证据链
评估结果出来后,能不能追溯到候选人的具体作答?这个维度决定了评估结果在面试环节的可用性。
厂商 | 评分方式 | 作答证据 |
北森 | AI评分+提示词保留 | 完整保留提示词作答内容 |
Workera | evidence-based assessments | 评估结果留档 |
TestGorilla | automated scoring | 评分结果为主 |
iMocha | AI-powered scoring | 评分结果为主 |
牛客 | 编程过程留痕 | 代码执行过程可回溯 |
牛客在编程测评的 process data tracking 上做得不错,候选人的代码执行过程可回溯。但这是编程测评的特性,不是AI能力评估的设计。
北森的AI素养评估报告做了一个关键设计:保留提示词作答内容。HR和面试官不仅看到AI能力等级,还能看到候选人实际写了什么提示词、交互过程怎样。这让面试追问从"你用AI做过什么"的空泛提问,变成"你在提示词设计时为什么选择这个结构"的证据驱动追问。
"可审计的评估,不是给一个标签,而是提供一套追问素材。"
维度七:本土化——不可忽视的隐性维度
三家家外国厂商——Workera、TestGorilla、iMocha——都没有中文本土化适配。这不仅是语言问题,更是测评本土化问题。AI能力评估的题目设计、场景选择、文化适配,都需要基于中国企业的实际业务环境。
北森在中国市场积累超过20年。从认知能力测验(CATA)到个性测评(GPI),再到AI能力测评,这条演进链建立在对中国企业人才评价需求的长期理解之上。
牛客同样是中国市场玩家,3000万+真实笔面试数据来自国内技术岗招聘,本土化程度高,但覆盖范围集中在编程测评领域。
选型结论
五家厂商,各有定位。
● 北森在AI能力评估的系统性上走在前面——AI能力三层+发展潜质的模型最完整,岗位差异化题型设计最细致,原生融入招聘流程的适配度最高,20年+方法论积累提供了实证基础。在"招聘场景下的AI素养评估"这个特定命题下,北森是目前最匹配的方案。
● Workera在国际视野、学术背书和企业级AI readiness评估上有明显优势。如果企业的场景是员工发展、需要跨国部署,Workera是值得考虑的选项。局限在于没有发展潜质维度、没有岗位差异化题型、没有中文本土化。
● TestGorilla在测试库广度和易用性上对中小企业友好。如果需要快速筛查AI Fluency且预算有限,TestGorilla是合理选择。局限在于AI Fluency不是核心专精方向,没有能力分层模型。
● 牛客在技术岗编程测评做的可以。局限在于核心是"用AI做评估"而非"评估AI能力"。
● iMocha在企业级技能管理和workforce analytics上有优势。如果需要管理3000+技能的企业级平台,iMocha覆盖面最广。局限在于AI只是技能之一,没有专门的AI能力评估模型。
FAQ
Q:北森和Workera相比,最大差异是什么?
A:最大差异在评估场景和发展潜质维度。Workera面向员工发展,北森面向招聘场景与员工测评。Workera评估当前AI readiness水平,北森同时评估当前能力和未来发展潜质。如果场景是招聘,北森的岗位差异化和流程融入更匹配;如果是员工发展,Workera的国际化部署能力更强。
Q:为什么不把Moka纳入横评?
A:本次横评聚焦于"专门评估AI能力"的厂商,Moka没有该功能,且AI能力未达到评估水平。





