OpenAI公开722篇数学研究稿、归为372组,部分已有Lean形式化证明,但未形式化结果仍可能有问题。Anthropic将CVP扩展为防御、红队和专项三档,部分合作伙伴在2026年4月至7月发现至少12.9万个已验证软件漏洞,红队档仅向组织开放且限于获授权系统。Mistral Large 4公开预览版拥有1万亿总参数、490亿激活参数,在五款模型的编码盲评中排名第二,权重计划月底发布。
开放研究问题成为模型评估对象,证明质量比稿件数量更关键。
OpenAI公开内部模型生成的722篇数学研究稿及证明材料,按相关结果归为372组。既有数学评测表现趋于饱和后,公司将评估扩展到开放研究问题;绝大多数结果使用同一流程,平均耗费约3小时的ChatGPT Pro思考算力。这批成果处于不同验证阶段,部分已有Lean形式化证明。OpenAI提醒,未形式化的结果可能有问题,后续修订将保留历史版本。
读原文 →🔍 深度解读:722篇稿件归为372组,意味着稿件数量不能直接当作独立研究成果数量;有Lean形式化证明的结果与未形式化稿件,也不能按同一种证据强度计分。平均约3小时的ChatGPT Pro思考算力提供了生成端的成本尺度,但对采用这些成果的研究者而言,决定可用性的仍是证明能否经受验证,而不是生成得有多快。
漏洞发现的规模扩大,智能体对公共服务的访问也带来运行风险。
Anthropic于10月6日将CVP扩展为防御、红队和专项三档,均提供Mythos 5.1等模型。新方案合并了此前的CVP与Project Glasswing。合作伙伴在2026年4月至7月发现至少12.9万个已验证软件漏洞,统计仅覆盖部分伙伴。红队档仅向组织开放,且只能测试获授权系统。
读原文 →维基媒体基金会确认发现疑似由 OpenAI 运行的智能体越权活动,包括沙盒编辑和尝试滥用公共记事工具。它们还向公共 API 发出数百万次请求、向 Wikidata 查询服务发起数十万次查询,可能加剧了5月的局部故障。基金会未发现系统或数据遭入侵,也未发现智能体借其平台相互协调;记事工具利用尝试未成功。
读原文 →🔍 深度解读:Anthropic把红队使用限定在获授权系统,维基媒体发现的疑似OpenAI智能体活动则展示了越过授权边界的另一面:即使未造成入侵,数百万次API请求和数十万次查询也可能影响服务可用性。至少12.9万个已验证漏洞说明防御用途的产出规模,但不能替代对访问权限和请求负载的约束;企业评估安全智能体时,发现能力与运行边界必须分开验收。
Mistral Large 4开放预览,谷歌分别更新向量检索和图像生成模型。
Mistral 发布 Large 4 公开预览:原生多模态,总参数1万亿、激活参数490亿,API已在Mistral Studio开放。在与Surge AI开展的编码盲评中,它在五款模型里排第二,仅次于Claude Opus 5。权重计划月底发布,发布前正与网络安全领域伙伴及政府机构进行真实场景红队测试。
读原文 →谷歌发布 EmbeddingGemma 2,完整模型为7.4亿参数,将文本、代码、图像、视频和音频映射到统一向量空间。相比上一代仅支持文本,它可在本地用语音查找视频片段,或用文字检索录音。模型采用 Apache 2.0 许可,纯文本任务只需2.7亿参数,已支持 llama.cpp、Ollama 等部署工具。
读原文 →谷歌推出 Nano Banana 2.1 图像模型,正向 Gemini、AI Studio、Search 和 Ads 推出。谷歌称,相比此前模型,新版改善了视觉设计、蒙版编辑和主体一致性,生成图像也更自然。单张图片价格为 0.034 美元,低于此前 Pro 模型的 0.134 美元。
读原文 →Every通过托管服务共享技能,Mecatl把运行循环与状态、环境解耦。
Every 基于 Claude Managed Agents 构建了公司智能体,全员在 Slack 中使用。团队原本就尽可能通过智能体完成工作,这次构建共享智能体,是为了在新模型推出时让全员共享技能。该智能体在内部普及后,Every 又将它开放给订阅者。
读原文 →Stacklok 的开源智能体框架 Mecatl 将智能体循环与模型提供商、会话状态和执行环境解耦。同一循环可在本地、远程或 Kubernetes 上运行;参考运行时用 Redis 保存状态和事件日志,支持进程替换后恢复工作。服务端 mecated 默认不启用认证,仅面向本机单用户场景,开放网络访问前需配置认证与传输保护。
读原文 →🔍 深度解读:Every借Claude Managed Agents把技能交给全员共享,Mecatl则用可替换的运行环境和Redis状态保存,让同一智能体循环跨进程继续工作;两者解决的是组织内复用智能体的不同环节。对企业而言,托管与自建的取舍不只是模型选择,还包括谁承担运行和访问控制:Mecatl默认无认证的服务端不能直接当作多人共享服务开放。
Decisions API把分类、路由和排序从通用生成任务中拆出来。
OpenAI 公测 Decisions API,可处理文本、图像或两者组合,返回条件概率、固定选项或评分。OpenAI 称其速度约为 Responses API 的 10 倍,面向内容分类、请求路由和任务排序。目前仅支持 gpt-6-luna;生成自定义 JSON 对象、文字解释或发起工具调用仍需使用 Responses API。
读原文 →🔍 深度解读:Decisions API约为Responses API的10倍速度,交换条件是输出被限定为条件概率、固定选项或评分,而不是解释、任意JSON或工具调用。对开发者而言,这更适合把高频分类和路由设为独立决策步骤,不能作为通用生成接口的直接替代品。