近日,科研团队推出面向AI编程代理的全新框架Arbor,通过独创的「假说树」架构存储长周期研发任务中的假设、实验过程及经验结论,在相同算力预算前提下,该框架的任务完成性能较现有同类模型高出2.5倍,可大幅降低AI辅助研发的落地成本,为生成式AI在复杂编程、长期科研场景的应用提供了新路径。
过去两年,AI编程工具已经成为不少开发者的日常辅助,但面对动辄持续数周、需要数十次迭代试错的复杂研发任务时,现有AI代理往往会出现「记忆丢失」问题:上一轮验证过的错误路径会被重复尝试,已经得出的实验结论无法复用,不仅拖慢研发进度,也造成了大量算力浪费。
目前主流的AI编程代理大多基于单次任务prompt逻辑设计,仅能处理单步骤、短周期的代码生成需求,针对需要长期迭代的系统开发、科研验证类任务,有效任务完成率普遍不足30%,算力消耗则会随着任务周期延长呈指数级上升。
此次推出的Arbor框架,核心创新点在于引入了「假说树」的存储逻辑:整个研发过程中提出的所有假设、对应的验证实验、成功或失败的结论,都会按关联关系存储为树状结构的节点,AI代理每一次新的尝试,都会先遍历整棵假说树排除已验证的错误路径,基于此前积累的结论推进研发,无需重复试错。
官方测试数据显示,在完全相同的算力预算、相同任务难度前提下,Arbor支撑的AI编程代理任务完成率较现有主流方案高出2.5倍,长周期研发任务的算力消耗平均降低62%。
除了编程场景外,Arbor的假说树架构已经开始测试适配更多需要长期试错的科研领域,包括新材料合成路径研发、小分子药物靶点筛选等,这类场景往往需要经历上百次实验迭代才能得到有效结论,传统AI代理的算力成本几乎无法覆盖落地需求。
据了解,目前已有多个开源研发团队正在测试Arbor的自定义适配接口,未来该框架有望推出轻量化版本,供中小科研团队低成本接入,进一步降低AI辅助科研的技术门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。