问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月,科技巨头Meta披露已推出全新内部数据采集工具,可将员工日常办公中的键盘敲击、鼠标移动、按钮点击等行为转化为结构化训练数据,用于旗下AI模型的迭代升级。该举措旨在填补当前AI训练的高质量交互数据缺口,预计将覆盖Meta内部数千名AI相关业务线员工,所有数据采集均将在合规框架下推进。
随着公开互联网数据的开采接近天花板,AI训练的“数据荒”已经成为制约大模型性能提升的核心瓶颈,头部科技企业都在试图开辟新的合规数据来源,Meta此次的内部数据采集计划正是这一趋势下的典型尝试。
过去几年,头部大模型厂商的训练数据主要来自公开互联网的文本、图片、视频内容,但随着AI训练对数据需求量呈指数级增长,公开数据的储备已经接近枯竭,同时版权纠纷的成本也在持续攀升。仅2025年一年,Meta就因为未经授权使用公开内容训练AI,累计支付的版权和解费用超过2亿美元,还面临多起集体诉讼的赔偿风险。
在这样的背景下,企业内部的非公开合规数据就成为各大厂商瞄准的新方向,相比来源复杂、版权归属不清的公开数据,内部数据的权属明确,只要征得相关人员同意,就能大幅降低合规风险。
和外界猜测的“采集员工工作内容”不同,本次Meta推出的工具仅记录操作行为的时序特征,并不会抓取员工产出的文本、代码、设计稿等核心内容。简单来说,工具会记录用户从打开文档到完成修改的每一步点击、鼠标移动轨迹、按键间隔,而不会读取文档里的具体文字。
这类行为数据的价值在于,能够还原人类完成复杂任务的决策路径:比如人类写代码时会先搭框架再调试细节,写文案时会多次修改表述逻辑,这些过程数据是此前公开训练数据里完全缺失的。Meta AI团队的内部测试显示,加入这类行为数据训练的代码模型,输出结果的一次通过率提升了27%,逻辑漏洞率下降了19%。
Meta的这一尝试也引发了行业对内部数据利用边界的讨论。有AI伦理研究者指出,企业在采集员工操作数据前,必须确保完全的知情同意,同时要做好数据的匿名化处理,避免将员工的个人行为特征和具体身份绑定,更不能将这类数据用于员工绩效考核。
目前已经有多家科技企业在跟进类似的探索,谷歌、OpenAI都在小范围测试用内部员工的操作数据优化垂直场景的AI模型,业内预计,到2027年,企业内部合规数据在AI训练数据中的占比将从当前的不足8%提升到30%,成为AI训练的重要数据来源。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。