扎克伯格近期公开反对AI减速论,称竞争与法律责任足以促使企业重视安全,并明确表示更青睐依靠评估人员确保AI安全。这条表态里,被反复提到的核心资源不是算力,不是模型参数,而是人——评估人员。但评估人员这个变量,在几乎所有科技公司的披露中都难以找到对应数字,它的规模、职责与独立性,也很难被外部验证。
一个无法被清晰量化的人力指标,正被用来支撑一个关于技术发展节奏的公共判断。这比很多财报里的模糊口径更需要拆开来看。
评估人员是做什么的,口径差异有多大,这一层远不像字面意思那样直白。在模型开发的语境里,它可以指内部红队,专门找模型漏洞;可以指标注团队,帮忙区分有害与无害输出;也可以指合规岗位,负责对照监管条文做文件核查。三种角色的技能、人数和介入时间点完全不同。把这三个数字加总,甚至只报一个总数,都会让外部读者看不出安全工作的质地。
这就引出一个基础方法问题:如果一个指标在不同公司之间定义不一致,它是否能被当作横向比较的标尺?答案通常是否定的。用评估人员数量来讨论AI安全投入的强弱,前提是该数字本身代表了同样的东西,但目前行业里还没有统一披露框架,这种比较的根基就相当脆弱。
一个只报人头数的安全声明,包含的信息量接近招聘广告
- 评估人员总数无法区分全职与外包、临时与长期
- 外部顾问与内部团队的汇报线完全不同
- 审核发现的问题数量没有统一的上报和复核标准
- 同一评估流程在不同模型上的执行深度难以外判
把这些维度都摊开之后,单看新闻标题里的一个数字或一句表态,能获得的信息其实非常薄。这不代表相关新闻没有价值,而是提醒关注市场的人:在评估AI安全这件事上,数字本身的可比性远低于硬件产能、资本开支或收入增速这类经过审计的数据。
同样的指标在不同公司能走到完全不同方向
评估人员这个指标有一个容易忽略的特征:它是企业管理层可以自主定义的。同一项工作,A公司可能记为安全审查,B公司可能记为数据质量保证,C公司可能直接归入产品开发。当这个数字出现在对外的口径中时,它的编排空间比营收或负债率大得多。
这就不是AI行业独有的现象了。很多公司披露某项投入时,都倾向于选择对自己有利的归集口径,且边界的变化通常不单独提示。研究这类声明的第一步,是找到去年的定义,再和今年的定义做对比。如果公司改了分类且没有说明,那前后两期数据放在一起看就会失真。这一点在阅读港交所上市公司公告时会经常遇到,处理方式同样适用于其他行业。
可以采用的应对方式并不复杂:把公司连续两年的相关口径并列,看分母有没有挪动,看统计加班或外包时如何处理,看审计意见是否对这一项提出限定。这些步骤看起来繁琐,但它们能解释一个数字为什么变,比单纯看大小更有实际意义。
扎克伯格这次对评估人员的强调,可以提供一个观察窗口:企业愿意把安全放在什么位置,和它愿意在上述这些口径里做到多透明,显然是两件需要分开讨论的事。目前还看不清绝大多数AI公司会在什么压力下推动建立统一的评估人员披露标准。对关注这个进程的从业者来说,追踪口径变化比接受任何单一表述都更重要。
本文要点
- 评估人员规模无法直接衡量安全水平
- 企业披露的评估数据常存在定义差异
- 安全指标误解可能引发市场错误定价