AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Meta推出内部数据采集工具 拟用员工操作数据训练AI模型

2026年4月,科技巨头Meta披露已推出全新内部数据采集工具,可将员工日常办公中的键盘敲击、鼠标移动、按钮点击等行为转化为结构化训练数据,用于旗下AI模型的迭代升级。该举措旨在填补当前AI训练的高质量交互数据缺口,预计将覆盖Meta内部数千名AI相关业务线员工,所有数据采集均将在合规框架下推进。

随着公开互联网数据的开采接近天花板,AI训练的“数据荒”已经成为制约大模型性能提升的核心瓶颈,头部科技企业都在试图开辟新的合规数据来源,Meta此次的内部数据采集计划正是这一趋势下的典型尝试。

过去几年,头部大模型厂商的训练数据主要来自公开互联网的文本、图片、视频内容,但随着AI训练对数据需求量呈指数级增长,公开数据的储备已经接近枯竭,同时版权纠纷的成本也在持续攀升。仅2025年一年,Meta就因为未经授权使用公开内容训练AI,累计支付的版权和解费用超过2亿美元,还面临多起集体诉讼的赔偿风险。

在这样的背景下,企业内部的非公开合规数据就成为各大厂商瞄准的新方向,相比来源复杂、版权归属不清的公开数据,内部数据的权属明确,只要征得相关人员同意,就能大幅降低合规风险。

和外界猜测的“采集员工工作内容”不同,本次Meta推出的工具仅记录操作行为的时序特征,并不会抓取员工产出的文本、代码、设计稿等核心内容。简单来说,工具会记录用户从打开文档到完成修改的每一步点击、鼠标移动轨迹、按键间隔,而不会读取文档里的具体文字。

这类行为数据的价值在于,能够还原人类完成复杂任务的决策路径:比如人类写代码时会先搭框架再调试细节,写文案时会多次修改表述逻辑,这些过程数据是此前公开训练数据里完全缺失的。Meta AI团队的内部测试显示,加入这类行为数据训练的代码模型,输出结果的一次通过率提升了27%,逻辑漏洞率下降了19%。

Meta的这一尝试也引发了行业对内部数据利用边界的讨论。有AI伦理研究者指出,企业在采集员工操作数据前,必须确保完全的知情同意,同时要做好数据的匿名化处理,避免将员工的个人行为特征和具体身份绑定,更不能将这类数据用于员工绩效考核。

目前已经有多家科技企业在跟进类似的探索,谷歌、OpenAI都在小范围测试用内部员工的操作数据优化垂直场景的AI模型,业内预计,到2027年,企业内部合规数据在AI训练数据中的占比将从当前的不足8%提升到30%,成为AI训练的重要数据来源。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。