近日,AI基础设施研发商Adaption Labs正式推出全新训练数据生成工具Invent a Dataset。该工具无需依赖现有种子语料库,仅通过用户输入的任务描述,即可自动生成符合训练要求的指令数据、偏好对齐数据行,大幅降低大语言模型垂直场景微调的数据标注、素材收集成本,有望缓解AI训练领域长期存在的高质量数据集供给不足痛点。
如果你想做一个面向线下餐饮门店的智能排班模型,过去首先要花至少1个月收集上万条行业排班历史数据,再花数万元请标注员清洗对齐,才能拿到可用的训练数据集——这个困扰了无数AI开发者的痛点,如今有了更高效的解决方案。
当前大语言模型向垂直场景渗透的过程中,高质量定制化训练数据集的获取成本,已经占到整体微调项目成本的60%以上。
对于大量中小开发团队、垂直行业从业者而言,既没有足够的资源积累专属种子语料库,也难以承担高昂的人工标注费用,不少有明确需求的场景AI落地项目,最终都卡在了训练数据供给环节。除此之外,基于公开语料清洗生成的数据集还普遍存在版权归属不清晰、数据同质化严重等问题,进一步限制了垂直模型的差异化竞争力。
此次Adaption Labs推出的Invent a Dataset,核心突破就在于完全抛弃了传统数据集生产对种子语料的依赖。
用户仅需要输入清晰的任务描述,例如“生成适用于中小学物理学科的AI答疑助教微调数据,覆盖初中力学全部知识点”,工具即可自动生成符合格式要求的指令-回复对、多轮对话样本、偏好排序数据等训练就绪的数据集内容,不需要额外的清洗、标注步骤。根据目前公布的内测数据,使用该工具生成的数据集微调的垂直模型,性能仅比同量级人工标注数据集训练的模型低1.8%,但生产周期缩短92%,整体成本仅为传统方式的8%,性价比优势极为明显。
在业内人士看来,Invent a Dataset的推出标志着AI训练数据的生产正式进入“按需定制”时代。
一方面,零门槛的数据集生成能力将大幅降低AI开发的准入门槛,个人开发者、小型团队不需要积累语料资源,也能快速落地垂直场景的专属模型;另一方面,纯生成的数据集从根源上规避了现有公开语料的版权风险,也能更好地满足不同场景的差异化训练需求,未来或将成为小参数垂直模型训练的主流数据供给方式。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。