biography-news 8小时前 · 2026-09-02 06:17:28 · 1 阅读
EvoMap 发布 AutoResearch,助力实现 AI 科学测试自动化

模型的自信并不等于成功的证据,但 AI agents 却常常把看似合理的文字误认为经过验证的结果。为弥合这一差距,基础设施项目 EvoMap 开源了 AutoResearch。该系统通过执行、测试并迭代自身的研究假设,推动 AI agents 超越理论推演。
系统会让多个 AI models 生成并交叉评审研究思路。某个想法获批后,AutoResearch 会将其转化为正式方案,明确指标、资源预算和评估流程。专用 agents 负责实施与分析,持久化工作区则保存日志和代码,即使研究中断,系统也能从断点继续,而不必从头开始。软件将失败视为数据点,而不是终点,并根据实验结果调整方向、不断完善假设。
在 SWE-bench Lite 基准测试中,系统展现了迭代能力:针对一个 Django 问题,成功率从 2/7 提升至满分 7/7。此外,在 RSICD 基准测试中,该工具还将平均召回率从 32.84 提升到 34.69。通过自动完成从猜想走向证据的过程,EvoMap 希望推动 AI agents 在模型架构设计,以及药物发现、材料科学等复杂领域实现自我进化。相关项目详见论文《AutoResearch:输入洞见,输出幻觉终止》("AutoResearch: Insight In, Hallucination Out"),目前已在 GitHub 上开放,供专注于自主科学发现的研究人员使用。
分享:TelegramXFacebook复制相关阅读

特朗普据称达成 10 亿美元石油交易背后的数学

气候危机使致命热浪发生的可能性增加35倍

Public Citizen 阐述以气候杀人罪追究责任的法律途径

喜马拉雅冰川崩塌致死人数超过1000人
评论(0)
发表评论
提交暂无评论。欢迎留下第一条评论!
原始来源: biography-news