← 文章 / 行业与公司动态
TechCrunch 5小时前 · 2026-09-19 21:26:43 · 3 阅读

获 a16z 押注,Vals 想成为 AI 基准测试的黄金标准

跑分测试已经成为 AI 公司验证模型能力的行业惯例——一旦指标好看,就能从竞争对手中脱颖而出,宣传自己的优势。换句话说,好的跑分结果几乎总能带来好的公关效果。

可惜的是,各家公司也已经摸清了如何钻传统跑分体系的空子——很多测试 早已过时,并不是为衡量现代模型的能力而设计的。

Vals 是一家 成立于 2024 年的初创公司,立志要修复这套千疮百孔的体系。成立不到两年,它已在科技圈站稳脚跟:去年完成了由 8VC 和 Bloomberg Beta 领投的种子轮融资;上个月,在经历一段快速扩张后,又完成了由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资

公司 25 岁的联合创始人 Rayan Krishnan 曾在 Palantir 实习,读斯坦福本科期间还为微软和该校大名鼎鼎的 AI 实验室工作过。Krishnan 说,Vals 的诞生源于他自己的观察:跑分体系已经跟不上它本应衡量的行业进步了。

“我们眼看着一大批能力很强的新模型快速涌向市场,而学术基准测试却跟不上这种前沿进展。”Krishnan 说。随着 AI 融入社会的方方面面,基准测试存在的意义,本应是验证模型是否真能做到公司宣传的那种水平。

上周,这位年轻的创始人带我参观了他的公司位于旧金山 Folsom 街的两层办公室——那是一栋老砖楼,一个世纪前曾是 一家大型啤酒厂的所在地。如今,这座曾经的工业建筑里入驻了多家初创公司,它们不再酿造啤酒,而是致力于打造科技行业的未来。

“过去,我认为评测旨在以非常抽象的方式衡量智能,”克里希南告诉我,“比如,模型是否掌握了足够的知识来应对类似律师资格考试的测试?”

在这方面,Vals 试图实现差异化。许多基准测试系统提供的试题是公开可得的(这可能让公司利用这些试题来训练模型,从而涉嫌在考试中作弊,好比在考场上作弊)。但 Vals 不公开披露其具体的测试材料。除了衡量 AI 模型的一般知识,Vals 还评估模型完成特定行业(如法律、金融、编程)复杂任务的能力。

“我们要做的是实际考察模型带来的真实影响,”克里希南说。“它们能否在各个领域产出与人类同等质量的工作成果?”

他表示,其理念不仅是检查积极结果,也要评估负面影响。希望能分析:“如果这些模型在现实世界中不受限制地运行,会产生哪些负面后果?”

Vals 正在测量的能力范围不断扩展。除了传统行业,这家初创公司还在向更多独特领域拓展。“我们拥有关于递归自我改进的基准测试。我们正在心理健康、网络安全、生物安全,甚至武装冲突法方面开展工作,以评估模型如何适用《日内瓦公约》,”克里希南分享道。

公司付费让 Vals 测试其模型,这个概念可能让人一时难以理解。为什么公司要付费去发现其模型表现不佳呢?但有效的度量标准有助于企业排查问题并随时间推移持续改进。克里希南将这种商业模式类比为学生支付费用给大学理事会(College Board)来参加 SAT 考试。

反过来,这些评测正在成为企业收购新 AI 模型时的关键决策因素。

这家初创公司近期披露,其当前营收已达到上年的八倍。团队规模也在扩张。Vals年初仅有8名员工,如今团队已迅速扩张至25人,规模翻了三倍。Krishnan表示,随着公司成长,计划搬迁至更大的办公室,并额外招募10到15名人员。公司近期还启动了一项计划,主要为联邦机构提供模型评估服务。

Krishnan认为,其公司构建的基准测试体系,代表了未来AI公司如何看待业务增长及建立公众信任的方式。

“AI公司正陆续上市。SpaceX已挂牌,Anthropic计划在今年晚些时候上市。我推测OpenAI也很快会公开。我认为,随着AI模型成为经济的核心组成部分并更广泛地普及,我们所进行的各类基准测试和评估,将驱动其使用,并成为这些公司在提交公开文件或讨论未来AI投资时不可或缺的关键部分,”他说道。

原始来源: TechCrunch

评论 (0)