Mistral Large 4:欧洲对OpenAI等公司的回应有多出色?

周二,Mistral 发布了 Mistral Large 4 的公开预览版(Public Preview),内部代号为 ML4,官方昵称为 “le Chonk”。该模型拥有 1 万亿个参数,每次查询激活 490 亿个参数,并具备原生多模态能力。权重预计于 10 月 27 日发布。在此之前,团队正在与安全公司、经过审核的合作伙伴及政府机构进行红队测试(Red-Teaming),上述机构可访问一个减弱内容审核并扩展了网络攻击能力的版本。据官方消息,该模型从零开始训练,使用了 3,800 至 4,000 块 NvidiaGrace-Blackwell 加速器,地点位于 Mistral 自有的欧洲数据中心。预览版也在同一基础设施上运行。大部分训练数据为多语言内容,涵盖 160 多种语言,包括所有欧盟官方语言。
Mistral 将 ML4 定位为除中国以外性能最强的开源权重模型,并宣称其表现“非常、非常接近”闭源顶级模型。据供应商称,该模型的重点在于编程、智能体工作流以及金融、法律、制造业和电气工程等行业。在网络安全领域,Mistral 提及了独立的 Artificial Analysis Cyber Index,该模型在此榜单中位列前五。在一项要求复现并修补开源软件真实漏洞的任务中,Mistral 给出的成绩为 82%;在 Cybench 数据集的 40 项练习中,得分为 93%。联合创始人兼首席科学家 Guillaume Lample 向 The Deep View 表示,对于安全流程而言,开放权重至关重要,因为企业不应依赖供应商持续运营某款模型。Lample 还指出,其他实验室往往根本未将许多专业领域作为优先事项。 该模型主要面向那些希望在自己硬件或私有云上部署的企业,同时也通过 Mistral 的 API 提供服务。由于其拥有 1 万亿参数,无法在桌面或笔记本电脑上运行,对许多大学而言,部署难度也相当大。Mistral 表示,其采用了与通过 Mistral Forge 产品提供给客户的相同的训练、微调和强化学习环境。尽管美国实验室对闭源模型收取溢价,Mistral 的收入来源则是基于云使用量的费用以及协助客户进行模型微调的工程支持。此次发布正值各方围绕顶级模型访问权的争端日益加剧之际。今年6月,Trump 政府曾临时对 OpenAI 和 Anthropic 模型的发布实施限制,理由是网络攻击方面的滥用风险。美国方面还指责中国实验室通过 Distillation(即用大模型的输出来训练小模型)缩小了性能差距。Mistral 则在9月完成了一轮 33 亿美元的融资,估值达 240 亿美元,创下欧洲科技公司的融资纪录;据 Financial Times 报道,其收入在过去一年增长了二十倍。 → Mistral Blog、The Deep View、Wired、Wall Street Journal
Synthszr 观点:在采购部门,Mistral 的成败系于一个关键问题:当服务商停服时,模型的归属权在谁手里?每次被迫迁移到新版本,都会搞砸那些花了数月去适配旧版Prompt、Evals 和 Agent 工作流上精心调优的行为,而没有人愿意一年内反复支付这笔“学费”。因此,10 月 27 日开放模型权重发布的日子,其分量远超网络指数中的 82 分:当完整的模型副本静静地躺在自家数据中心里时,任何服务商都无法单方面“解约”。从商业逻辑上看,开放权重只需按算力消耗付费,Mistral 的盈利模式则转向托管服务和微调工程师,而非按Token加收费用。Mistral 营收在不到一年内激增二十倍,很大程度上得益于美国服务商频繁更新弃用周期(Deprecation)和复杂的出口限制所引发的一种“恐惧”。
OpenAI 在欧盟标记 ChatGPT 生成文本,同义词替换即可轻松绕过检测
OpenAI 计划对欧盟用户通过 ChatGPT 和 Codex 生成的文本添加不可见水印。这种水印嵌入在选词模式中,只有通过专门的检测器才能发现。该技术名为 textGrain,其方法将公开分享,以便开发者能在此基础之上进行构建。目前,开发者已可通过 API 在全球范围内对选定模型启用此功能,默认设置为关闭状态。预计在未来几周,ChatGPT 和 Codex 的所有套餐版将在欧盟地区上线此功能,但暂无全球推广计划。此举的起因是欧盟 AI 法案,该法规要求以软件方式识别机器生成的文本。检测器目前仍保持封闭:仅获授权的研究人员和机构可申请访问权限,公众暂时无法使用。 → The Neuron
Synthszr 评论:如果替换了四分之一的单词,检测准确率就会从 92% 骤降至 17%。这揭示了当前关于生成内容检测所面临的根本挑战。在图像、音频和视频领域,去除水印至少还需要消耗算力,但在文本领域,只需将内容输入第二个模型或使用同义词库即可轻松规避。要追溯内容的来源,必须在生成的那一刻就嵌入签名,并依靠记录链追踪文件的传输路径,而不是对已生成的内容进行事后筛查。
Google 的 Nano Banana 2.1 价格减半
Google 于 10 月 6 日发布了 Nano Banana 2.1,这是其图像生成与图像编辑模型的新版本。新模型已在 Gemini 应用、Google 搜索的 AI Mode、Google Ads 以及 AI Studio、Flow、Stitch 等开发者工具中推出。据官方介绍,该版本在各方面均超越了前代,视觉设计、基于蒙版的局部图像编辑以及多步编辑中的主体一致性都有明显提升。Google 自己的测试显示,在文生图对比中,其综合偏好 ELO 分达 1050 分,Nano Banana 2 为 990 分,Nano Banana Pro 为 935 分;在信息图的事实准确性上,Google 给出的数字是 0.521,前代仅为 0.179。据 Decrypt 指出,发布时尚无独立测试结果。 {Alphabet} → Decrypt
Synthszr 观点:事实准确性 0.521 说白了就是差不多每两张信息图中就有一张经不起检验,而这已经是官方自测的最佳成绩。1050 的 ELO 分来自一个偏好测试,其测试设计、评估者和 Prompt 集合都由厂商自己设定,发布时没人能复核。在一个没有上限的评分体系里,只要对比对象都是自家模型,任何差距都能包装成“飞跃”。这次发布目前唯一可以核实的只有价格:每 1000 张图片 0.0336 美元,是 Nano Banana 2 的一半——月底账单上见分晓。
Anthropic 推出“设备版 MCP”Model Hardware Standard,随即被挤爆
Anthropic 于八月底推出了硬件模型标准(Model Hardware Standard,MHS),这是一套通用接口,供 AI 模型和智能体控制物理设备。Anthropic 有益部署团队(Beneficial Deployments Team)的 Alek Kemeny 向 The Deep View 形容该项目为“硬件界的 MCP”,其灵感源自 Anthropic 于 2024 年 11 月开源的 Model Context Protocol。据该项目博客数据,此协议当前每月SDK下载量已达 5 亿次。MHS 最初面向科研领域的实验室自动化场景,但团队表示,首两周内报名参与的组织数量超出预期 30 倍,参与者涵盖半导体制造、汽车、航空、能源及关键基础设施等多个行业。量子计算公司 QuEra 已采用 MHS,引导 Claude 生成激光控制程序;在 700 次测试中,激光在 695 次成功恢复,复杂用例的响应时间从人类专家所需的 5 至 10 分钟大幅缩短至 10 到 14 秒。卡内基梅隆大学的一个团队则利用 MHS 连接了移液机器人、平板读取器和机