Reflection 公布 Beam,总参数 5010 亿、激活参数 230 亿,公司称其高级推理成绩接近 GLM-5.2,推理计算量仅为后者的 1/3 至 1/4,权重尚待本月晚些时候发布。Codex 更新使 GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%;UT Austin 的约 3.5 万次运行研究则发现,上下文压缩到约三分之一 token 后,运行仍可能慢 20%–80%。OpenAI 将为欧盟符合条件的 ChatGPT、Codex 文本添加统计水印,但 改写或翻译可移除水印,检测器初期仅向获批研究者开放。
我的判断
我认为今天最有意思的线索是:换个衡量口径,效率优势就会变样。压缩上下文可能反而更慢,Claude 的订阅优势按任务成本算也明显缩小;我更关心完成同类任务的时间和成本,而不是省了多少 token、额度有多大。
Beam 对标推理计算效率,Rho-1 将机器人动作纳入全模态模型。
Reflection公布首款开放权重模型 Beam,采用稀疏MoE架构,总参数5010亿、激活参数230亿,面向编程、推理和智能体任务。公司称,在高级推理测试中,Beam成绩接近GLM-5.2,推理计算量仅为后者的1/3至1/4。模型仍在进行最终红队测试和评估,现可申请早期访问,权重及技术报告计划本月晚些时候发布。
读原文 →Reka 发布 Rho-1 研究预览,这是一款拥有 190 亿参数的全模态模型。它在同一个神经网络内理解和生成文本、图像、视频及机器人动作,把多媒体能力与机器人动作生成纳入同一模型。Reka 称,该模型使用 320 张 H100,耗时约三个月从零训练完成。
读原文 →🔍 深度解读:Beam 对 GLM-5.2 的比较以推理计算量为尺度,Rho-1 则把机器人动作与多媒体生成放进同一网络,两者不能仅按参数规模排出高下。对开发者而言,选型需要先区分目标:编程与智能体任务看单位计算带来的任务收益,全模态应用则看跨模态理解能否落实为可用的生成结果。
模型提速、订阅额度和上下文压缩,需要放到同一任务口径下比较。
Tibo宣布首日更新:GPT-6 Astra和GPT-6.1 Sol的默认速度提升约50%。此次提速覆盖旗下所有产品的订阅使用场景,也包括通过Sign in with ChatGPT接入的合作产品,如OpenCode、Pi、Amp和Devin。用户无需更改设置即可享受提速。
读原文 →SemiAnalysis实测Anthropic、OpenAI等多家订阅方案,发现Claude的API等价价值超过OpenAI的5倍。测试通过分别隔离各类token、观察用量表变化来测算额度消耗;同一套餐的价值会随模型和工作负载改变。scaling01按任务成本调整后,将Claude的优势缩小至1.3至2.9倍。
读原文 →UT Austin 针对编码智能体的上下文压缩开展研究,覆盖约 3.5 万次运行。结果显示,某些压缩方案虽然只使用完整上下文约三分之一的 token,运行却可能慢 20%–80%,减少 token 并不必然降低延迟。按阈值触发压缩优于按步骤触发,但最佳策略因模型而异。
读原文 →🔍 深度解读:GPT-6 Astra 与 GPT-6.1 Sol 的约 50% 提速,不能与上下文压缩的 token 节省直接相加:UT Austin 测到的 20%–80% 变慢说明,压缩策略可能抵消速度收益。Claude 的订阅优势从 API 等价价值超过 5 倍,缩小到按任务成本计算的 1.3 至 2.9 倍,也说明 token 额度不是最终产出。对企业而言,更有用的比较单位是完成同类任务所需的时间和成本,而不是单独比较速度或额度。
Cognition 管理长期记忆,Cursor 为执行中的智能体增加引导入口。
Cognition 将基于 git 和 Markdown 的 Agent Memory Repo 发布为开放标准,配套的 Dreaming 是定期运行的记忆维护智能体。它从跨会话记录中发现模式、添加记忆,同时合并重复条目、删除过时内容,并核查来源以解决矛盾。Devin 的本地试用需手动调用记忆功能,不包含自动启动或定时 Dreaming。
读原文 →Cursor SDK 新增运行中引导能力,允许开发者在智能体执行过程中发送消息。调用 run.steer() 后,新消息会加入智能体的下一轮交互。若子智能体此时正在执行任务,它会转入后台继续工作。
读原文 →🔍 深度解读:Cognition 的 Agent Memory Repo 决定哪些历史经验进入后续会话,Cursor 的 run.steer() 则让新指令进入下一轮交互,两者分别处理长期状态和当前执行的纠偏。接入这两种能力不等于获得自动闭环:Devin 本地试用的记忆仍需手动调用,而 Cursor 被引导时子智能体可继续在后台工作。开发者因此需要把记忆维护的触发方式与仍在执行的任务状态一起纳入控制逻辑。
欧盟产品适用范围、全球 API 可选开关与检测权限各有边界。
OpenAI 将为欧盟符合条件的 ChatGPT、Codex 生成文本添加不可见统计水印,全球 API 则提供可选开关。此举回应欧盟监管要求,将已有的图像、音频溯源措施扩展到文本。但改写或翻译可移除水印,检测器初期仅向获批研究者开放。
读原文 →90 多个 Opus 5.5 智能体在 3 天内筛出两种模拟候选。
Vals AI称,90多个Opus 5.5智能体在3天内协助筛出两种室温磁性半导体候选:YBaMnFeO₅和KV[Cr(CN)₆]。这项探索针对一个延续数十年的材料研究目标:按自旋分选电子,同时让材料的磁性相互抵消。此次找到的两种材料仍是模拟中的候选。
读原文 →