AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

TinyFish推出开源多智能体工具BigSet 低门槛生成结构化动态数据集

6月初,AI开发服务商TinyFish正式开源其全新多智能体系统BigSet,该工具支持用户仅通过自然语言描述需求,即可自动调取实时网页数据生成符合要求的结构化动态数据集,大幅降低AI训练、市场调研等场景的数据采集预处理门槛,目前已在全球主流开源平台开放完整代码与使用文档,上线首周开发者关注度突破万人次。

对于绝大多数AI开发者和行业分析师而言,“数据荒”从来不是指公开数据太少,而是想要快速拿到符合特定需求的结构化数据成本太高——写爬虫、去重、清洗、对齐格式,一系列操作往往要耗去项目过半的时间成本。

据2026年Q1全球AI开发生态报告显示,中小规模AI研发项目中,数据采集与预处理环节的平均耗时占整体研发周期的62%,近7成非技术背景的从业者表示,无法独立完成定制化数据集的搭建工作,很多创新想法卡在了“拿不到合适的数据”这第一步。

过往市面上的数据集工具要么需要用户掌握代码能力编写爬虫脚本,要么仅能提供固定时间范围的静态数据集,无法满足实时调研、动态模型训练等场景的需求,缺口长期存在。

此次TinyFish推出的BigSet核心是一套分工明确的多智能体工作流:需求解析智能体先把用户的自然语言需求拆解成明确的数据维度、时间范围、格式要求;数据爬取智能体自动在公开网页中定向检索符合要求的实时数据,自动避开常规反爬限制;数据清洗智能体自动完成去重、补全缺失值、统一单位等操作;最后导出智能体根据用户需求输出CSV、JSON等常用格式的文件,还支持设置自动更新频率,形成可实时同步的“活数据集”。

在实测场景中,完成一份包含10个维度、千条量级的行业数据集,BigSet的平均耗时仅为4分钟,同等工作量下人工处理至少需要3个工作日,效率提升超过100倍。

本次TinyFish选择完全开源BigSet的全部代码,无任何商用限制,个人开发者和企业都可以免费使用、二次修改。同时官方还配套上线了120个覆盖电商、消费电子、文娱等领域的预设模板,用户哪怕不懂任何数据相关知识,直接修改模板里的需求关键词就能生成自己需要的数据集。

据了解,TinyFish团队后续还将推出BigSet的企业级私有化版本,支持对接企业内部数据源,满足金融、医疗等强合规行业的数据集搭建需求。在AI开发逐步走向大众化的当下,这类降低环节门槛的工具,正在让更多非技术背景的创作者有机会把想法变成落地的AI应用。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。