[AI新闻] 今天没太多新鲜事
如果你还在看这篇,不妨放下手机,好好享受周末吧。
AI 新闻:2026年10月1日至10月2日。我们筛查了 12 个 Reddit 子版块、544 个 Twitter 账号,但没有监测 Discord。你可以在 AINews 网站搜索往期内容。提醒一下,AINews 现已成为 Latent Space 的一个版块。你可以自定义邮件接收频率。
AI Twitter 速报
GPT-6.1 Sol 与 Sonnet 5.5 重塑成本性能边界
-
GPT-6.1 Sol 发布:OpenAI 将 Sol 的定价定为每百万输入/输出 token 2美元/10美元,而 Astra 为 10美元/50美元(定价摘要)。
-
声称的效果:据报道,Sol 在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分(摘要)。
-
定位:OpenAI 员工形容它“好、便宜且快”(@reach_vb)。
-
Codex 用量:全球 Codex 用量重置时间定为太平洋时间 10 月 2 日上午 10 点(@reach_vb)。
-
工具使用:Sol 据称“非常喜欢 codemode”,这与 GPT 模型在该模式下接受训练的情况一致(@badlogicgames,codemode 备注)。
-
-
Agent Arena 排名:Sol [Max] 以 #5 排名进入榜单(+11.23%),单个任务中位成本为 0.56 美元(@arena)。
-
Sol 成本对比:它比 GPT-6 Sol 便宜 39%,但得分高出 1.52 分;比 Astra 便宜 81%,得分差距在 1.04 分以内。
-
Sonnet 5.5:Sonnet 5.5 [Max] 首次上榜即位列第 3(+12.5%),并在 Chat 类目中排名第一。单任务成本 $2.74,而第 2 名 Opus 5.5 仅 $1.58,因此未能进入 Pareto 前沿(首秀、前沿)。
Anthropic 的地位:Anthropic 的模型现已包揽 Agent Arena 前三名。
Code 与 Text Arena:Sol 曾短暂登上 WebDev 第 3,随后被 Sonnet 5.5 挤到第 4(周报)。
Sonnet 在 WebDev:Sonnet 目前落后 GPT-6 Astra [Max] 2 分,但成本低 80%。
Gemini 4 Argon:Argon [High] 登顶 Text Arena 第一。
开源模型:MiMo-V2.6-Pro 和 Flash 分别以开源模型第 5 和第 9 的名次进入 Agent Arena。
其他独立评测:WeirdML v3 显示 Sol 的 token 效率很高,成绩接近 Astra 但峰值略低。在同一基准上,Sonnet 5.5 胜过 Opus 5,Grok 4.7 胜过 Kimi-K3;这些结果尚不完整(@htihle)。
推理风格:Design Arena 分析了 324 份思考摘要,发现 Astra 的对冲表述频率约为 Opus 5.5 的 20 倍,而 Opus 在约五分之四的摘要中都早早下定结论(@DesignArena)。
Step 5 Preview:StepFun 的模型在 Vals 开源权重模型中排名第 7,单任务成本 $2.54。平均每任务耗时近两小时,上下文窗口达 1M token(Vals、详情)。
传闻(未经证实):
Fable 5.5:有传言称 Claude Fable 5.5 将于下周发布,并称其性能超越据报道因安全问题而延期的 "Astra 6.1"。发帖人表示无法核实这两条消息(@kimmonismus、后续)。
GPT-6 Astra Lite:发现了一个名为“GPT-6 Astra Lite”的列表项,@scaling01 推测它与 Sol 是同一个模型(@scaling01)。
决策模型与开放权重:llama.cpp 增加了 /v1/systemone 端点,用于本地“Jev 风格”决策模型推理(@ggerganov)。
本地运行:通过
llama serve -hf ggml-org/Kev-4B-GGUF启动模型(@ClementDelangue)。Jared Palmer 发布了一篇文章,介绍了 Kev 1.0 的工作原理(文章)。生态系统:Perplexity 声称 pplx-decider-v1-27b 在 11 个基准测试中的平均得分为 85.7%,领先于 Jev(@AravSrinivas)。Clef 的决策模型已上线 Ollama(@lucataco)。
怀疑论观点:@mervenoyann 认为决策模型只是零样本分类器的重新包装(推文)。
校准分析:一篇博文将 Jev 风格的校准与价值及 Q 函数预测联系起来(@SOURADIPCHAKR18)。
webAI TwIL-LM3-Pro:这款 3.66B 参数模型基于 Granite 4.2 进行后训练。在 webAI 的测试中,其在形式逻辑上大致与 Qwen3-8B 相当。Q4 GGUF 大小为 2.09 GiB,许可证为非商业使用(@kimmonismus)。
Reka RIDM:Reka 以 Apache 2.0 协议发布了一款逆动力学模型。该模型在游戏上训练,能泛化到真实视频并提取动作和相机操作(@RekaAILabs)。
Agent 框架、助手和开发工具
OpenAI dots:Sam Altman 称 dots 是他最喜欢的 OpenAI 产品,并表示随着它学习他的工作流,产品每天都在变得更好(@sama)。
能力:Dot 可在不同应用间保持上下文,协调 Codex 任务,并标记需要关注的事项(@OpenAIDevs)。
对比:有用户更推崇 Grokbot 的多智能体“幕僚长”架构(@kimmonismus)。而 DIY 克隆版则采用 Pi、Telegram 网关及任意模型组合(@_alejandroao)。
Muse 配件:Meta 开源了 ESP32 固件及 Linux SDK,用于构建适配 Muse 的硬件(@natfriedman)。
Muse Home Link:Meta 自产了 5,000 台智能家居桥,订阅用户在库存充足时可免费获得(@alexandr_wang,发货)。
可扩展框架:DeepSeek Harness 已推出 macOS 和 Windows 桌面版;Linux 用户可从 npm 安装
@deepseek-ai/dsh(@deepseek_ai)。Claude Code 修改:Mods 是包含类似中间件钩子的 Claude Code 插件(@lydiahallie)。新推出的“You should know”插件会启动一个子代理,标记用户可能忽略的重要输出(@ClaudeDevs)。
Pi Durable:Pi 现可通过 Agents SDK v0.26.0 运行在 Cloudflare Durable Objects 上,这与 Pi v1.0 的发布同步(@mattzcarey,@badlogicgames)。
背景:@omarsar0 将此次更新解读为向可塑性框架的转变(线程)。
T3 Code orchestrator 重写:该项目用户突破 40 万(@theo)。历时 4 个月、横跨 1912 个文件、共 823 次提交的大 PR 已合并(@maria_rcks)。
新功能:重写版新增 Pi 支持、跨 provider 的
delegate_task、ACP 注册表、thread 分叉、对话中途切换模型、subagent 谱系视图以及定时任务(功能列表)。
平台动态:OpenAI 的 Agents API 支持一键调用浏览器/电脑操作,并推出 Bedrock Managed Agents 和可移植环境,号称轮次可靠性达 99.97%、工具调用提速 20%(@stevendcoffey)。
Cursor Rollouts:Rollouts 一旦发现回归问题,会定位到出问题的 PR、创建 issue,并提供一键云端 agent 修复(@cursor_ai)。
Cloudflare:Sandbox SDK 1.0 让 Durable Objects 直接掌控沙箱容器(@CFchangelog)。Cloudflare 还上线了请求 Traces(@WalshyDev)。
研究:Agent 训练、长程控制与 AI 数学
Multi-harness RL(Hugging Face):同一组模型权重,在一个 harness 下得分 62%,换另一个只剩 33%(@huggingface)。
方法:用一个代理层兼容 OpenAI、Anthropic 和 Gemini 三种 API 格式,并记录采样出的 token ID 和 logprobs 用于训练,harness 本身无需任何改动。
结果:LFM2.5-2.6B 在四个 harness 上的成绩从 42% 提升到 54%,工具调用次数减少 31%。用 3189 条 Qwen3.8-27B rollout 数据做 SFT,则在 47.5% 处停滞不前。
开源:训练器、数据集和全部七个训练好的模型均已开放。
Credit 分配与 RL 效率:ProVer 通过 judge 定位决定性轨迹片段,并基于该片段两侧的 rollout 来设定其优势值。论文报告了相对于 GRPO 在 Qwen3.5-2B 上 +9.91%、Qwen3.5-4B 上 +7.12% 的相对提升(@omarsar0)。
部分 rollout:AC2 使用学习到的 critic 对 token 块进行评分,因此训练只需部分 rollout(@wen_kaiyue)。
前沿学习:该方法针对处于能力边界的问题进行训练,因为模型总是或从不解决的问题会使 GRPO 梯度为零(@robinfaro13)。
锐化税:论文量化了后训练后 pass@K 可扩展性的损失,并提出了 PTGS(一种逐 prompt 温度采样器)(@iScienceLuvr)。
SFT 与 RL:另一项研究发现,SFT 泛化效果较差是因为其数据是 off-policy,而非目标函数所致。将专家轨迹改写为基座模型风格可弥补这一差距(@maximelabonne)。
长程控制与上下文:Meta Superintelligence Labs 报告称,在 ProgramBench 上,使用专用控制器可将 GPT-5.5 从 63.7% 提升至 71.5%(与 Codex 的 58.0% 对比),且使用的 worker 数量和预算相同(@dair_ai)。
上下文压缩:微软的免训练 FOCUS 方法可将峰值上下文减少最多 48%,并将任务成功率提升最多 8.9 个百分点(@dair_ai)。
长上下文退化:NVIDIA 的 Long-Transduction 研究测量了七个开源模型在上下文从 4K 到 128K 时准确率下降 62.8% 的现象(@dair_ai)。
多智能体协同:在 AgentWorld 中,不到三分之一的多智能体动作有助于完成任务,而协同类任务的成功率仅为 12%(@omarsar0)。
Apple LoopCD:该方法将循环次数减半,同时把 AIME 2024 pass@1 从 61.88% 提升到 73.33%(@arankomatsuzaki)。
AI 攻克公开数学难题:Meta 发布六篇论文,仅通过 meta.ai 普通聊天界面、用 Muse Spark 1.1 和 1.2 完成公开数学难题的研究,没有任何定制化脚手架(@AIatMeta,论文列表)。
流程:每篇论文都标注了哪些段落主要由人类起草、哪些由 AI 起草,并由另一组数学家审阅。
Google Cogentic:这个 Gemini 多智能体系统在五个公开理论难题上取得了新结果(@omarsar0)。
Cogentic 设计:每份草稿都必须通过两个对抗性验证器,各智能体共享一份已验证引理的账本。大多数问题约需 100 次调用,最难的问题约需 1000 次。
图像后训练:Arena 将 Bradley-Terry 奖励模型与忠实度、约束和防 reward hacking 奖励相结合(@arena)。
结果:FLUX.2-dev 提升 69 Elo 至 1202,Ideogram 4 提升 20 Elo 至 1224。
基准测试、评估可信度与安全
考察研究品味的基准:ScholarCatalyst 要求智能体找出研究项目背后的“催化剂论文”。标签由 184 位一作作者针对他们自己的 207 个项目标注,据称离饱和还很远(@yoonholeee)。
EurekaBench:该基准测试智能体能否在六个科学领域中发现真正全新的洞见(@JiayiiGeng)。
Vals Web Search Index:该指数保持模型和 harness 不变,只更换搜索工具,并在金融和法律任务上对最终答案打分(@ValsAI)。
验证:不使用搜索时,Agent 在法律领域得分 2.9%、金融领域 7.4%,而使用搜索可达 30–50%。Vals 还引用了一项研究,某模型不用搜索就在 BrowseComp 上答对了 44.5%(详情)。
SWE 找 bug 基准:这个新基准让 Agent 从较早的 commit 出发,用后续 commit 中真实修复的 bug 来评分。
批评:Lucas Beyer 认为这主要考的是查全率,而且这种构造方式很容易被针对性训练(@giffmana)。
作者回应:作者表示,只要测试集不泄露,针对找 bug 做训练没什么问题(@OfirPress)。
评测完整性疑问:David Rein 质疑 Terminal Bench 背后的框架 Harbor 是否允许 Agent 在评估前修改自己的执行轨迹,并声明自己可能是看错了代码(@idavidrein)。
开源模型的攻击能力:The Batch 报道 GLM-5.3 在漏洞利用上几乎追平 Claude Mythos,成绩为 12% vs 14%(@DeepLearningAI)。
有争议的说法:有评论者称 GLM-5.3 Flash 在 ExploitBench 上超过了 Mythos Preview(@teortaxesTex)。
无审查版本:一个去掉审查的 GLM-5.3 版本正在 Hugging Face 上流传(@kimmonismus)。
安全研究与防护措施:一篇新论文提出在训练中利用内部信号来改进对齐,同时不削弱白盒监控能力(@lenalibon)。
NeurIPS 录用:“Models That Know How Evaluations Are Designed Score Safer” 被 NeurIPS 2026 接收(@HaritzPuerto)。
误报问题:Opus 5.5 在进行频谱图音节标注时,频繁触发“推理提取”安全措施(@ChaseBrowe32432)。
涌现的世界知识:向模型输入 16,200 个经纬坐标并询问“是陆地还是水域”,然后将回答绘制出来,得到一张可识别的世界地图(@karpathy)。
推理、硬件与系统
基于 DeepSeek 内核的 Ascend 950:通过分析 DeepSeek 开源的 DeepGEMM、FlashMLA、TileKernels 和 DeepEP,推测出该芯片的布局(@ZhihuFrontier)。
预估规格:该芯片拥有 32 个 AI 核心,每个核心将一个 Cube 核心与两个 Vector 核心配对。预估峰值性能在 BF16/FP8/FP4 精度下分别约为 432/865/1,730 TFLOPS。
供应能力:尽管有消息称 950 芯片已于 8 月上市,但供应可能受限(@teortaxesTex)。
Prime Inference:Prime Intellect 使用 NVFP4 存储 MLA 隐向量,将行大小从 576 字节缩小至 352 字节,相比 FP8 可多缓存约 50% 的 token(@PrimeIntellect)。
技术栈:在 vLLM 和 Dynamo 上部署 GLM-5.3,其稀疏 MLA 内核即将集成到 FlashInfer 中(@vllm_project)。
低精度基准测试:Stas Bekman 在 B200 上测试发现,NVFP4 比 MXFP4 效率高约 9%,且精度更高(@StasBekman)。
mamf-finder:该工具现在支持对 FP8、MXFP8、MXFP4 和 NVFP4 进行基准测试(更新)。
内存与速度:NVHBM 将内存控制器移入定制基板,宣称带宽比 HBM4E 高出最多 30%,功耗降低 15%(@vikramskr)。
产能经济性(Epoch):Epoch 估计,AI 基础设施很快就能支持数亿到数十亿个 agent(@EpochAIResearch)。
需求缺口:仅 20% 的利用率就意味着每年 2.6 万亿至 5.3 万亿美元 的支出,而到 2027 年底,实验室的收入预计约为 1 万亿美元(详情)。
平台:SemiAnalysis 将谷歌的 GPU 集群评级为 Gold 级,并指出 ConnectX NCCL 插件现在会自动激活(@SemiAnalysis_)。
联邦学习:Google Research 推出了基于 TEE 的联邦学习,具备可验证的差分隐私(@GoogleResearch)。
行业与政策
Anthropic 与梵蒂冈:《纽约时报》报道,Chris Olah 曾提议撤回教皇 AI 通谕发布活动,该通谕文本否认了机器意识(@ChristopherHale)。
游说:据报道,Olah 的团队曾游说教皇的顾问,希望他们认真考虑模型意识的问题。他最终出席了活动(@kimmonismus)。
背景:文章开篇引用 Olah 的话称:“我们不知道 AI 模型是否具有意识”(@buccocapital)。
批评声音:Aidan Gomez 批评这场行动是道德上的傲慢(@aidangomez)。Lucas Beyer 则注意到一份文字记录中把“create”改成了“train”(@giffmana)。
反安全影响行动:一份报告称,一个由前白宫副幕僚长领导的团体计划投入至少 1 亿美元,把 AI 风险警告包装成一场有预谋的协调行动(@NeelNanda5)。
新机构:Nathan Lambert 和 Tom Zick 创立了 Trillium Labs,这是一家非营利组织,致力于开放的后训练配方与基础设施(@natolambert)。
资金:初期资助来自 Halcyon Futures 和 Schmidt Sciences。
Underdog:这家端侧 AI 创业公司宣布获得 a16z、Khosla 等机构的投资(@0xSigil)。
治理与市场:Yoshua Bengio 加入了加拿大新成立的国家 AI 委员会(@Yoshua_Bengio)。
Meta:Meta 已与 Virtue AI 分道扬镳(@AndrewCurran_)。
Nvidia:据 Bloomberg 报道,在增加 1500 亿美元回购计划后,Nvidia 市值创下近 5.7 万亿美元的历史新高(@kimmonismus)。
热门推文(按互动量)
NYT 关于 Olah 与教皇通谕的报道 — 2.87 万
Karpathy 的“陆地还是水域”评测 — 1.64 万
Altman 谈“点” — 6800
Muse Gadgets 发布公告 — 4900
DeepSeek Harness 桌面版发布 — 4.3K
Altman 谈与 Cerebras 的合作 — 4.1K
Trillium Labs 正式成立 — 2.6K
AI Reddit 精选
/r/LocalLlama + /r/localLLM 精选
1. Qwen 本地推理:27B 基准测试、微调与 MTP
我把 iPhone 变成 24 GB MacBook 的第二块 GPU:Qwen 3.8 27B prefill 提速 29–44%,手机还承担部分 CTX 窗口。 (热度: 1192): OP 开发了 backburner,一个
llama.cppfork / 分布式推理方案,把 Qwen 3.8 27B IQ4_XS 的一部分从24 GBM4 Pro MacBook 通过10 Gb/sUSB-C 卸载到 iPhone 17 Pro Max 上:Mac 运行第1–40层并传输激活值,手机用 Metal 4 张量运算运行第41–64层。相比只用 Mac,端到端 prefill 提升为8k时+35%、16k时+44%、32k时+29%、48k时+30%;一次27k的冷启动会话,从原版llama.cpp的245 s/ fork 仅用 Mac 的228 s降到接入手机后的168 s。超过64k上下文后,手机转而存放旧的 KV 页——最多约5.7 GB,支持196k–229k的 8-bit 上下文分配——并计算旧 key 的注意力;在140k上下文测试中,加入用 Neural Engine 编译的16kkey 页后,生成延迟从279 ms/token降到176 ms/token。一个相关的技术追问是:能否将 iPhone 作为次级 GPU 的方案扩展到 iPad,尤其是配备更强 Apple Silicon 芯片和更大内存的高端 iPad Pro。这意味着 iPad 可能提供比 iPhone 更优的卸载(offload)性能,或能容纳更大的上下文窗口,从而成为本地 LLM 推理更理想的伴侣设备。
Qwen3.8-27B-Humanlike-Chat 2.0:像真人一样打字,现支持工具调用与更好的指令遵循(活跃度:805):LessThanThreeAI 发布了 Qwen3.8-27B-Humanlike-Chat 2.0。该模型基于 huihui-ai 发布的 abliterated Qwen3.8-27B 合并了 LoRA 适配器,目前已在 Hugging Face 上提供 GGUF、BF16 和 LoRA 格式,并附带演示 Space。v2 版本用在线策略蒸馏(on-policy distillation)取代了普通的 SFT:学生模型生成回复时,由两个教师模型对 token 进行评分——一个是 v1 版本,并隐式注入“像真人打字”的指令以优化聊天和角色扮演行为;另一个是基座模型,负责指令遵循、工具使用和代码生成。这种方式在保留非正式短信风格的同时,提升了工具使用能力和可控性。官方公布的对比评估结果如下(对比 abliterated 基座模型):IFBench
37.3 → 43.7,When2Call48 → 58,BFCL 无关性测试60 → 78,在 IFEval/GSM8K/BFCL 简单版上持平或小幅提升(83.5 / 89.1 / 98),但在 MMLU-Pro(78.5 → 72.5)和 LiveCodeBench(56 → 51)上出现回退;自定义的“ishuman”评判基准显示,该模型生成文本被判定为人类撰写的比例为23.5%,而 abliterated 基座模型仅为0.3%,官方 Qwen3.8-27B 为15.1%。热评中的技术讨论较少;唯一相关的批评指出,该模型的“类人”语域可能更像青少年发短信,而非广泛意义上的人类日常对话。有位评论者提出了一个模型迁移问题:用在 Qwen3.8-27B-Humanlike-Chat 2.0 上的那套拟人化对话微调/对齐方法,是否能得到类似的效果。这是整篇中唯一有技术含量的讨论,涉及训练方案能否跨架构泛化,以及行为风格微调能否迁移到更大的 Gemma 系列模型上。
差距没他们说的那么大:本地 27B 在真实代码测试中几乎追平前沿模型(活跃度:730):OP 报告了一次单任务 DeepSWE/本地代码基准测试:在单张 RTX 4090 24GB 上,通过 llama.cpp b11115 + llama-swap v257 运行 Qwen3.8-27B GGUF,具体是来自 unsloth/Qwen3.8-27B-GGUF 的
Qwen3.8-27B-UD-IQ4_XS.gguf(14.25GB),配置为ctx-size 196608、IQ4_XS量化、q8_0K/V cache、投机 MTP draft,以及 DeepSeek 风格的4096推理预算。实测结果:解码速度115 tok/s,显存峰值22,934 MiB,一个代码评审任务拿到12/12满分;另一个 DeepSWE 任务通过隐藏测试40/43、已有测试109/109,即部分得分0.980,但按全过/全不过判定则为0。OP 后来更正了对比数据:所引用的96.6%是所有已发布试验的部分得分均值,而前沿模型在该任务上的子集为部分得分99.8%、通过率85.3%,数据来自 DeepSWE v1.1 原始数据。相关文章分别介绍了 24GB 显存装下该模型及上下文配置的做法(上下文上限)和该任务的 DeepSWE 结果(本地模型的底气);OP 强调这只是针对特定任务的结果,并不是说本地 27B 模型在113个任务的基准上能全面比肩前沿模型。评论区对这种宽泛的说法持怀疑态度:一位同时用过 "Flash 和 27B" 的用户表示"差距是真实存在的",另一位则认为这个结论站不住脚——即使是前沿编程模型的表现也不稳定,~24–72B的模型或许能搞定离散的子任务,但一旦需要人类把更大的工程拆解成适合模型的粒度,往往就失去价值了。多位评论者指出,这种近乎持平的性能表现很可能是某个基准测试饱和造成的假象:本地
27B模型即使在Q8量化下,也能在小型或离散型编码任务中表现良好,但在需要前沿模型(如 Claude Opus)才能胜任的更复杂的实际任务上仍然力不从心。一个反复出现的技术质疑是,代码评估往往低估了项目级任务拆解的重要性:
24B–72B的本地模型或许能解决孤立的工单,但在处理较大的工作项时,将问题拆解为模型能处理的子任务所需的人工成本,往往超过了模型带来的效率提升。有实际使用过 Gemini Flash 和本地
27B模型的用户反馈称,两者的性能差距依然显著,尤其是在非平凡的编码工作负载中,前沿模型在可靠性和任务完成率上表现更好。
Qwen4Exp: add MTP by am17an · Pull Request #29761 · ggml-org/llama.cpp (热度:405):
llama.cppPR #29761 通过--spec-type draft-mtp参数,为 Qwen3.8-Flash Next 添加了 MTP 投机解码支持,经过约17h的开发后合并至aman/qwen4-opt分支。在 DGX Spark 上对 Qwen3.8-Flash-Nextiq4_xs进行基准测试,使用-np 1 -lzm on --spec-draft-n-max 3参数,显示解码吞吐量从28.36提升至43.88 tok/s(1.55 倍),延迟加速比 1.54 倍,在24个任务上的平均投机接受率为0.640;GGUF 量化模型可在 Hugging Face 上获取。评论者指出,该模型对许多本地环境而言仍然过大:其IQ4_NLGGUF 文件被拆分为一个极小的10.9 MB分片和一个102 GB的分片,这削弱了“轻松从 Qwen 3.8 27B 切换过来”的观念。另有评论者提到 Gufo 也支持 MTP。有评论者反映,在他们的测试中启用 MTP 反而让推理变慢了,并认为 MTP 对dense models(稠密模型)可能更有用,而对整体架构特别大的模型效果不佳,因为 MTP 头的接受率/命中率很低。他的推测是:MTP 头无法有效预测或压缩大模型足够多的行为,导致投机解码的收益下降。
有用户指出,Gufo 早已支持 MTP,也就是说 llama.cpp 在 Qwen 类实验模型的 MTP 工具链/后端方面还在追赶。
另一位评论者表示,他们一直在通过 tabbyapi 使用 EXL3 版本,因为 llama.cpp GGUF 推理对他们的工作负载来说“慢太多了”。他们打算在这个 PR 合入后重新测试,但此前的经验表明,在评估 Qwen4Exp/MTP 支持时,EXL3/tabbyapi 仍是一个值得对比的性能基准。
2. 本地 Agent 工具:决策模型与 MCP
Pi 1.0 发布 - 默认内置 MCP 支持(热度:679):Earendil 发布了
Pi 1.0,这是其极简 agent 框架的稳定版本。Codemode 现在默认原生支持 MCP,还加入了对非 LLM/图像模型的支持、虚拟模型扩展、延迟工具加载、Anthropic 缓存预热、会话中途插入系统消息,以及 TUI 更新。该版本还推出了实验性的 MIT 许可 Pi Durable,面向超出终端/编码 agent 场景的长时运行 agentic 应用,同时保留了 Pi 极简、可扩展的架构。热门评论集中在命名歧义上——“pi” 与太多 AI/开发工具重名——还有人希望澄清 Codemode 到底是什么。有评论者贴出了 Earendil 关于为何支持 MCP 的说明:“You said no MCP”。有评论者贴出了维护者对 Pi 1.0 重新支持 MCP 的解释,指向了 “You said no MCP” 这篇文章。讨论帖指出,尽管作者此前出于项目理念一度拒绝,MCP 现在已默认原生支持,用户认为这对工具/服务器集成工作流来说是“至关重要的补充”。
Clef: Cloudflare 的开源权重决策模型(热度:619):Cloudflare 发布了 Clef,一个面向本地/自托管场景的开源权重“决策模型”。热门评论指出,Clef 基于 Qwen3.8-27B 后训练而来,同时还发布了基于 Qwen3.5-9B 后训练的 clef-flash。评论反响总体积极:大家认为 Clef 填补了本地模型生态的一块空白,并迫不及待想自己跑一下基准测试。
评论者指出 Cloudflare Clef 基于 Qwen3.8-27B 后训练而来,另有基于 Qwen3.5-9B 后训练的更小版本 clef-flash,认为它有望成为本地推理场景中一个重要的开源权重“决策模型”。
有人提出了技术上的疑虑:Clef 在量化后的质量如何,尤其是 Q8 以下,因为本地部署通常依赖低比特量化版本,而决策模型在激进压缩下性能可能非线性下降。
基准讨论主要围绕与 Laya、Kev 9B、DiffusionGemma Jev 等模型的对比,但有评论者批评评测集太弱,认为 Clef 应该在 jevbench 上与头部模型比较,而不是拿较弱的开源 Jev 基线来比。
llama.cpp 新功能:决策模型(活跃度:574):帖子宣布
llama.cpp支持“决策模型”:这类本地模型类似于“Jev/Jeff”,旨在充当控制器或分类器——从动作、延续或行为选项中做出选择——而非纯粹的自由生成器。提供的评论中没有讨论基准测试数据或底层实现细节;主要提出的具体用例是引导本地角色扮演模型,避免角色 “在场景中途跑偏”。 评论者对 Jev 作为可防守的产品或类别持怀疑态度,认为这一想法“没有护城河”,且迅速被大量类似 Jev 的模型克隆。另一些人表示,除了可能的智能体/角色扮演控制外,他们仍不清楚这些模型在实践中有何实际用途。一位评论者将决策模型概括为本质上的受约束分类循环:提供一个包含允许类别及结构化/非结构化输入的 JSON schema,然后让模型为每个条目精确选择一个类别。技术层面的问题在于,llama.cpp 的新增支持是否在普通提示词约束下的 JSON 分类之外增添了有意义的推理时行为,还是主要旨在标准化本地模型的工作流。
提出的一个实际用例是将决策模型应用于本地角色扮演智能体,以减少长场景中的脱轨——即使用辅助模型或决策步骤在生成前强制执行状态/意图约束。该线程未报告基准测试或实施结果,但突显了一种用于角色一致性和场景状态管理的潜在控制层模式。
非技术性 AI 子版块回顾
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Gemini 4 Argon 访问争议
刚取消了 Google One AI 订阅。(热度:1838):楼主称 Google 的付费 Google One AI Pro 档位已无法使用前沿的 Gemini 模型:在传言中的 Gemini 4 Argon 发布后,访问权限据称只面向企业 "Fairwind" 合作伙伴、付费 API 用户,以及即将推出的 Google AI Ultra 档位,而 Pro 用户仍停留在 Gemini 3.8 Flash。他认为这相比 Gemini 2.5 Pro 时代是一种退步——当时更高端的推理模型和宽裕的额度向更广泛的用户开放——并与 Anthropic/OpenAI 的订阅对比,称后者向普通付费用户提供前沿模型。帖子中没有具体的跑分数据,只有“亮眼的基准测试图表”的说法和一个
1Mtoken 的输出上限。热门评论大多不买账:有用户表示自己订阅主要是为了 Google 存储空间,AI 只是附赠;还有人质疑帖子的真实性,怀疑是 Gemini 代写,或者是新注册账号的机器人/水军行为。有评论者认为,Google/Anthropic/OpenAI 每月
$20的 AI 订阅更像是受限试用,而非生产级服务——尽管挂着 "Pro" 的名头,持续高强度使用时仍会遇到各种实际限制。他还推测,考虑到底层的推理成本,Google 可能在 Google One AI Pro 订阅上处于补贴甚至亏本状态。关于发布节奏的说明指出,Gemini Ultra 用户似乎会率先获得访问权限,但Google 并未明确排除 Pro 档位使用 Astra 等功能的可能。这位评论者认为这只是典型的分阶段发布,并不意味着 Pro 档被永久排除在外。
为什么要公开发布一个公众还用不上的模型??(热度:1624):图片是一张据称来自 Google/Gemini 的公告截图,内容为 “Gemini 4 Argon”,宣称在软件工程、知识工作和网络安全防御方面达到前沿水平,并带有超大的
1M token output limit(100 万 token 输出上限):图片。这条帖子的技术意义主要在于模型发布的信息传播方式,而非评测本身:标题质疑 Google 为什么要在用户还无法使用时就公开宣布一个模型,而图片本身也没有提供任何基准测试、API 细节、定价或上线时间表。评论区将其与以往“发布了但用不上”的模型上线案例类比,包括 Anthropic 的 “mythos” 传闻和 Google 被指的 “3.5 pro” 处理方式。主流观点持怀疑态度:用户可能会感到不满,还有一条评论猜测这次公告“纯粹是做给投资人看的”。
2. Claude Opus 5.5 退化报告
Opus 5.5 性能回退——如何度量、如何察觉、如何追责 (Activity: 2722): 楼主指出 Anthropic 的 Opus 5.5 在发布后的前 5–6 天表现尚可,但随后在复杂的 C++、3D、物理引擎及 Blender MCP 任务上出现了明显的性能衰退。楼主列举了措辞异常以及代码/输出质量下降等证据,并建议保留发布当天的精确 prompt 与输出,以及延迟测量数据,以检测潜在的性能变动,如量化(quantization)、路由策略调整或高负载下的服务端优化。楼主将此视为可能违反欧盟消费者权益法的问题,具体涉及《数字内容指令 2019/770》第 7–8 条规定的合规期望,以及第 19 条规定的修改/撤回通知义务。楼主认为,发布时的基准测试(benchmarks)和“最强模型”的市场宣传可能构成具有法律约束力的期望。 评论者普遍认同,闭源模型提供商可以悄无声息地降低性能或重新路由模型,且需要独立的审计机制;但目前尚无评论者提供可复现的基准测试或直接证据。有评论者报告 Higgsfield 的输出也出现了类似的质量下降,描述了在初期生成质量很强后,后续使用导致积分浪费的情况。
评论者提出了针对所谓闭源模型性能衰退的核心度量难题:由于 Anthropic 托管模型的权重、prompt、路由及服务端配置不透明,用户认为在没有独立审计、固定的基准 prompt、重复采样和历史基准线的情况下,很难证明存在性能回归或“削弱”(nerf)。有用户特别询问是否有“有效的测试或可靠的性能削弱追踪站点”,凸显了人们对第三方纵向评估而非轶事对比的需求。
多名用户报告了 Opus 5.5 在实际应用工作流中出现的轶事性性能回退:有用户称该模型现在需要借助 Gemini 3.8 Flash 才能发现代码 bug,而另一用户则称 Higgsfield 的设计/渲染输出在初期表现优异后有所下降,导致积分浪费。这些报告并非受控基准测试,但它们指明了用户希望被追踪的任务类型:bug 发现准确率、设计/渲染 prompt 的忠实度,以及日间的输出一致性。
好吧,起初我不信别人说的,但 Opus 5.5 突然不对劲了(热度:2045):一位 Claude Code Enterprise PAYG 用户反映,在月度用量限制重置后,Claude Opus 5.5 Med 的表现明显下滑:从原来的架构优先、遵循 DRY/SOLID 原则、节省 token 的实现方式,变成了冗长的开场白、重复代码、“垃圾代码”,token 消耗回到了之前 Opus 5 的水平。他们声称用量在大约一小时内从
70%飙升到90%,而此前一周高强度使用 O5.5(每天约12h)期间从未触发过额度上限提示,并提供了每日费用和 token 数据作对比。有评论者引用外部情绪追踪数据,显示 Opus 5.5 在 modelsentiment.com 上的 Reddit 情绪分数从 9 月 25–28 日的71–73/100跌至昨天的58和今天的55,但指出该指标衡量的是用户观点而非后端模型变更。热门评论猜测 Anthropic 可能在发布热度过后削减了算力、悄悄更改了路由或调整了 token 计账方式,但都没有直接证据。争论的核心是信任与可靠性问题:用户希望模型行为稳定、部署和版本管理透明,而不是发布后暗中降级。一位追踪 Reddit 情绪的评论者报告称,Claude Opus 5.5 的情绪分数大幅下跌:9 月 25–28 日稳定在
71–73/100,随后在 modelsentiment.com 上跌至昨天的58和今天的55。他们指出,这衡量的是用户观点而非模型行为,因此无法证实后端确实发生了变更,但可能反映出用户感知到的质量突然下滑。多位用户反映 Opus 5.5 疑似出现能力回退,尤其在指令遵循和多段落提示词执行方面:有人说模型现在“提到 3 个要点却只回应 2 个”,被追问时甚至能自己意识到遗漏。另一位用户表示所有任务都改回了“xhigh effort”模式,暗示默认设置下的可靠性下降,或推理与指令遵从表现变差。
有技术猜测认为,Anthropic 可能在发布/跑分期间临时调用了更多算力,之后削减了推理资源或调整了 token 计量方式,从而造成用户感知的质量下滑。这一猜测尚无证实,但核心抱怨在于可复现性和稳定性:用户希望模型发布后行为保持稳定,而不是在同一个产品名下悄悄发生变化。
3. AI 视频模型与运动控制
Orbiting Lora + MiniMax 首尾帧控制效果惊艳(热度:2263):有用户分享了一个 MiniMax-H3 LoRA,可基于首尾帧条件生成锁定主体的
360°环绕镜头:pablodawson/MiniMax-H3-360-Orbit-LoRA。提示词明确将场景限定在冻结瞬间——物体不变形、姿态不漂移、动作不延续——让镜头视差成为唯一的运动来源,从而得到更干净的伪体积感输出,适合下游重建工作流。相关 Reddit 演示视频因返回403 Forbidden无法查看。评论区认为这个 LoRA 对制作 3D 资产特别有用:有人建议把生成的环绕片段喂给 Opus 提取快照用于 3D 模型生成,称这样能更好保留风格。还有人推测,这类环绕一致性视频生成让用消费级手段对现有影片做体积/VR 观看更近了一步。一位评论者描述了一种工作流:将环绕或生成的 3D 视频片段输入 Opus,并指示其提取快照用于创建 3D 模型。他们报告称,与直接提示模型不同,这种方法能显著提升风格捕捉效果,表明环绕视频充当了强大的多视角条件源。
输出中观察到的一个技术缺陷是运动分割不一致:人物基本保持静止,而汽车、头发和背景爆炸等次要元素继续移动。这表明 MiniMax 在合成环境动态的同时,保留了首尾帧约束下的人物姿态,从而可能导致部分动画不匹配。
Griffin,首个通过视频图灵测试的人类交互模型,已在全双工 AI 视频 NVIDIA 基准测试中位列第一——44% 的人认为它是真人,而其他系统仅为 3%(热度:2018):一个 Reddit 帖子声称 Griffin,被称为“人类交互模型”,是首个通过视频图灵测试的系统,并在 NVIDIA 的全双工 AI 视频基准测试中排名
#1,其中44%的参与者将其判定为真人,而其他系统大约为~3%。由于链接到的 Reddit 视频因 403 禁止访问响应无法独立访问,因此无法从提供的来源验证基准测试细节、方法论和模型架构。 评论大多非技术性:一位用户戏称人类/AI 的揭示弄反了,而另一位则论证该技术是多余的,且很可能被用于掠夺性应用。一位评论者强调,
44%的人类识别率在技术上是显著的,因为人类通常对细微的面部、时序和行为异常非常敏感——这是 CGI/仿生人恐怖谷效应的基础。他们论证这表明 Griffin 远远超越了先前的“假人”系统,特别是与帖子声称其他系统在相同视频图灵风格基准测试中得分约为~3%相比。
讨论中提到一个很有现实意义的技术滥用案例:AI 生成的求职者。据称,虚假候选人可以投递简历、参加视频面试、成功入职,然后获取公司内部平台权限,或把发放的办公设备据为己有。有评论者指出,审查不严、背调不到位的大公司可能根本发现不了这类 AI 代理面试,这意味着全双工视频 Agent 会明显加剧身份验证和招聘安全方面的风险。