deepseek v4pro上新?
来自频道: @DNSPODT
xAI 发布 Grok 4.6,强化长程 Agent 与交互式开发能力
2026 年 8 月 12 日,xAI 正式发布 Grok 4.6。新模型在 Grok 4.5 基础上继续强化长时间运行的 Agent、复杂多步骤任务,以及交互式和视觉应用开发能力。xAI 称其可持续完成研究、信息分析、大型代码库操作以及从想法到完整应用的开发流程。

训练方面,Grok 4.6 进行了比 4.5 更长的补充训练,并加入模型生成的推理与技术数据、高质量工程数据,同时更新优化器和训练方法。后续 SFT 数据由 Grok 4.5 重新生成,并在知识工作、通用编程、Kernel 优化、Web 开发和 CAD 等环境中进行了 Agentic RL。

在 xAI 公布的评测中,Grok 4.6 High 的 Artificial Analysis Intelligence Index 得分为 61,与 GPT-5.6 Sol Max 持平;CursorBench 3.2 为 69.9%,FrontierCode 1.1 Extended 为 61.3%。这些结果包含 xAI 自测以及公开的第三方模型成绩,仍应结合独立评测看待。

Grok 4.6 已上线 Grok Build、Cursor、xAI API,并通过 OpenRouter、Vercel 和 Cloudflare 等平台提供。API 起价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,另有速度更快、价格翻倍的版本。

来源:xAI 官方公告《Introducing Grok 4.6
来自频道: @DNSPODT
‼️huge ssi news.

ilya is about to take his first tentative steps out of the age of research and back into the age of scale. it’s time to smell what ssi is cooking.

ssi have built a small reasoning engine that can compete with much larger training runs because his data is better curated to meta learning. but, more importantly.

we’re about to step into the era of TTT (test time training. gradient descent happening in real time to solve your problems). so instead of a context window you get actual learning.

and because it’s so sample efficient it can be trained on hard to verify tasks that other paradigms can’t touch. everyone else’s weights are frozen, they struggle out of distribution. ssi have created something that has a bundle of knowledge but can truly learn in real time and use that to your advantage.

current approaches are trying to hack their way to ‘learn’ with memory trick......


我们正在步入 TTT(Test-Time Training,测试时训练)的时代:梯度下降将在推理过程中实时发生,模型不再只是从上下文中检索和组合已有信息,而是能够在解决问题的过程中真正完成学习。换言之,我们获得的不再仅仅是一个不断扩大的上下文窗口,而是一种可以持续更新自身的学习机制。
正因为这种机制具有极高的样本效率,它有望被应用于那些难以验证、因而长期难以用于训练的任务。传统模型的参数在部署后基本保持冻结,一旦面对分布外问题,往往只能依赖已有知识和上下文进行推断;而 SSI 所构建的系统则不同:它既拥有广泛的知识基础,又能够在面对新问题时实时学习,并将新获得的经验直接用于后续推理。
目前的许多方案都在试图借助记忆、检索等机制模拟“学习”,但这种系统所做的事情更加直接:它会真正更新自身的权重,保留关键经验,并有望逐渐形成更加接近人类的持续性推理能力。这不仅是对现有技术路线的一次改进,更可能意味着整个范式的转变。


Source
来自频道: @DNSPODT
中共中央 全国人大常委会 国务院 全国政协讣告 朱镕基同志逝世

中国共产党中央委员会、中华人民共和国全国人民代表大会常务委员会、中华人民共和国国务院、中国人民政治协商会议全国委员会沉痛宣告:中国共产党的优秀党员,久经考验的忠诚的共产主义战士,杰出的无产阶级革命家、政治家,党和国家的卓越领导人,中国共产党第十四届、十五届中央政治局常委,国务院原总理朱镕基同志,因病医治无效,于2026年8月12日11时06分在北京逝世,享年98岁。
来自频道: @DNSPODT
来自频道: @DNSPODT
来自频道: @DNSPODT
Docker 高危漏洞“CopyEscape”公开:docker cp 可越界写入宿主机

安全公司 Imperva 公开了 Docker 漏洞 CVE-2026-17106,代号“CopyEscape”。GitHub 将其评级为 High,CVSS v4 评分 7.1。漏洞存在于 Docker 文件复制与归档解压流程中,攻击者控制的容器可构造恶意归档,使 docker cp 在从容器向外复制文件时突破用户指定的目标目录,在宿主机上创建或覆盖文件。

该漏洞并不能让恶意容器在运行后自动逃逸,利用过程需要用户或自动化系统对攻击者控制的容器执行 docker cp。成功利用后的权限取决于 Docker CLI 本身:普通用户执行时可覆盖该账户有权写入的文件;如果 Linux 上的 CI、运维任务或管理员以高权限执行复制,则可能进一步实现 root 级代码执行。Imperva 已在 Linux Docker Engine 29.6.1 与 macOS Docker Desktop 4.81.0 上验证攻击。

Docker Sandboxes 的 sbx cp copy-out 同样受到 CVE-2026-17106 影响,这使漏洞也进入 AI Coding Agent 场景。攻击者如果能够控制沙箱生成的文件,在宿主机提取 Agent 产物时可能触发同类越界写入。Docker 已在 Sandboxes 中修复该问题。

Docker Engine 29.7.0 已将 moby/go-archive 更新至修复版本,当前 29.7.2 同样包含修复;Docker Desktop 4.86.0 也已于 8 月 10 日修复该漏洞。对于仍在使用旧版本的用户,建议尽快升级,并避免对不可信的运行中容器执行高权限 docker cp

Docker Security Announcements
来自频道: @DNSPODT
国产大飞机 C919 正式执飞国际商业航线

据央视新闻报道,今天(12 日)起,国航北京至蒙古国首都乌兰巴托航线将由国产大飞机 C919 执飞,标志着国产大飞机正式开启国际定期商业航线运营。

C919 的首个国际商业航班号为 CA723,计划于 8 月 12 日 15:00 从北京首都飞往乌兰巴托,19:00 的 CA724 航班从乌兰巴托飞往北京首都。

来源:证券时报
来自频道: @DNSPODT
中国对日稀土出口大幅下降 涉及违规管制案件

据中国海关数据,今年上半年,中国七种受管制稀土对日本出口量同比下降51%,其中6月降幅达81%。用于电动汽车马达及高科技领域的镝、铽、钇等关键稀土金属,对日出口量已降至零。

中国自今年1月起加强了对日两用物项出口管制。近期,多名日本公民因涉嫌违反相关出口管制规定在中国被依法拘留。

来源:日经网
来自频道: @DNSPODT
SpaceXAI 发布 Grok Bot

SpaceXAI 于 8 月 11 日正式发布 Grok Bot,将其定位为可以长期接手实际工作的“AI 队友”。每个 Bot 都拥有独立的云端计算机,可以登录用户现有的应用、网站和内部工具,在用户离线后继续执行任务,并在需要人工审批或判断时再请求介入。

与传统需要预先配置工作流的自动化工具不同,Grok Bot 主要通过自然语言交互。用户可以像给同事发消息一样直接分配任务,Bot 会保留历史对话和工作上下文,并逐渐学习用户的处理习惯。用户也可以让 Bot 观察一次完整操作流程,随后将其保存为可重复执行的 routine。

Grok Bot 支持多个智能体并行协作。不同 Bot 可以互相发送消息、共享线程上下文、分配任务,并在群聊中自行协调。SpaceXAI 表示,公司内部已经将其用于销售拓客、营销活动、CRM 更新、发票处理、招聘、Bug 复现与修复等多步骤工作。

目前 Grok Bot 仍处于 Beta 阶段,已面向 SuperGrok Heavy、Cursor Ultra 和 Cursor Teams Premium 订阅用户开放,可在桌面端和 iOS 使用;企业用户目前可以加入候补名单。

来源:SpaceXAI 官方公告《Introducing Grok Bot
来自频道: @DNSPODT
ChatGPT Desktop支持Linux

Use ChatGPT, ChatGPT Work, and Codex where you already work and build, with your projects and browser workflows on supported Linux

https://x.com/i/status/2087231351502385266
来自频道: @DNSPODT
研究披露前沿模型 API 共性漏洞:加密推理轨迹可被跨模型提取

8月11日,来自 MATS Research、ELLIS 图宾根研究所、马克斯·普朗克智能系统研究所、图宾根大学与 Snyk 等机构的研究人员公开论文《Stealing Reasoning Traces from Proprietary LLM APIs》。论文指出,OpenAI、Anthropic 和 Google 的部分推理模型 API 会把完整思维链封装为加密区块交给客户端保存,以便在后续请求中恢复推理状态。实验发现,这些区块没有被严格绑定到原始用户、会话和模型,可在同一供应商的不同账户、会话及模型之间重放。

攻击并未破解加密密钥,也不需要进入供应商基础设施。研究人员先取得前沿模型生成的合法加密推理区块,再将其提交给同一模型家族中防护较弱的低成本模型,通过转录类越狱提示要求后者输出区块对应的明文推理。论文展示了 Claude Opus 4.8 至 Haiku 4.5、GPT-5.6 Sol 至 Luna,以及 Gemini 系列内部的提取实验。被修改的密文仍会被 API 拒绝,但未经修改的合法区块可以被重放,相当于把较弱模型变成了“解码代理”。
在120道 Codeforces 问题上,恢复文本的长度与 API 报告的隐藏推理 token 数量高度接近,表明该方法恢复的并非普通推理摘要。研究人员同时承认,由于无法取得供应商保存的真实明文作为参照,不能确认恢复结果中的每一个 token 都与原始推理完全一致。

隐私风险是论文披露的主要问题之一。团队从 GitHub 和 Hugging Face 收集了6,708条公开智能体轨迹,重建315,320个推理区块,其中1,028个区块包含至少一项隐私泄漏,328条完整轨迹出现真实敏感信息。排除基准测试中的合成数据后,研究人员仍发现62个不同的 API 密钥、33个密码、24个访问令牌、7个私钥和30个个人邮箱。704项真实隐私信息中,有64项只存在于隐藏推理区块,未出现在用户可见的会话记录中,这意味着仅清理明文日志并不能保证公开数据安全。

论文还演示了另外三类影响:低成本批量提取专有推理用于模型蒸馏;从安全拒绝背后的隐藏推理中取得危险操作细节;以及把恶意指令放入不可见的加密区块,使后续智能体在缺少明文痕迹的情况下执行数据外传等操作。研究人员还观察到 Kimi-K3 和 GLM-5.2 对部分 Claude、GPT 推理片段表现出异常高的行为兼容性,但论文明确强调,这些实验不能证明相关模型曾使用专有推理数据进行蒸馏或记忆训练。

研究团队在发表前已向相关模型供应商、微软和 Hugging Face 披露问题。论文的可复现性声明称,经过供应商采取缓解措施,截至2026年8月,论文图1所示的原始攻击已经无法复现。WIRED 报道称,三家供应商均已调整 API,按原路径提取隐私数据已被阻断,但部分推理轨迹仍可能通过类似方法恢复,因此目前更准确的描述是“已缓解”,而非确认完成架构层面的彻底修复。

论文建议供应商将推理状态留在服务器端,仅向客户端提供随机标识符;或使用 AEAD 将区块与用户、会话、前序对话及模型版本绑定,同时轮换旧密钥、限制跨模型重放,并训练模型拒绝推理转录请求。对于开发者和数据集发布者,最直接的措施是在共享智能体轨迹或 API 日志前,彻底删除 encrypted_content、signature、thinkingSignature 等不透明推理字段,而不是只清理可见文本。

来源:arXiv 论文及完整 PDF (arXiv);Stolen Thoughts 项目页 (Stolen Thoughts);Matthew Green 加密推理背景分析 (加密工程思考);WIRED 报道 (WIRED)
WIRED
来自频道: @DNSPODT
8月11日,Manus发布《致Manus用户的一封信》。Manus表示,即将恢复以独立公司的形式运营,作为恢复独立运营的一部分,同时为遵守特定司法辖区的监管要求,部分用户在2025年12月29日当天或之后产生的数据,将于2026年8月23日08:00起至8月24日期间(SGT)被删除。受影响的用户可以从现在起至2026年8月23日07:59(SGT)备份数据,并可从2026年8月25日08:00(SGT)起恢复数据。在此期间,未受影响的用户可以照常使用Manus,无需采取任何行动。

来源:华尔街见闻
来自频道: @DNSPODT
英国海事贸易行动中心(UKMTO)在接到报告后发布了一则警告通报,该报告称也门阿尔莫哈港外海发生一起事件,一艘在南部红海的货船被不明射弹击中,导致伤亡人数和性质不明。

Source
来自频道: @DNSPODT
蚂蚁百灵开源轻量级模型 Ling-3.0-tiny 支持边缘端高效部署

蚂蚁百灵于近期在 Hugging Face 平台开源轻量级混合推理 MoE 模型 Ling-3.0-tiny。该模型总参数量为 7.9B,每 Token 激活参数仅 1.3B,采用 KDA 与 MLA 混合架构结合 128 个路由专家的稀疏 MoE 网络,在计算成本与上下文处理能力之间取得平衡。模型原生支持快速响应与多步骤推理两种模式,并提供 BF16、FP8 和 INT4 多种权重版本。

作为一款专为本地及边缘端部署设计的模型,Ling-3.0-tiny 已在英伟达 DGX Spark 以及搭载 Apple Silicon 的 MacBook、Mac mini 等设备上完成验证。在 FP8 量化下,模型在 M4 Pro 芯片上可实现约 86-90 Token/s 的推理速度,8K 上下文峰值内存占用仅约 8.34 GiB,大幅降低了本地部署高阶 AI 能力的硬件门槛。

来源:Hugging Face
来自频道: @DNSPODT
消息称谷歌已搁置发布 Gemini 3.5 Pro AI 模型

行业分析机构 Semi Analysis 最新报告称,谷歌内部可能已搁置 Gemini 3.5 Pro 模型,为填补该模型迟迟未发布留下的空档,该公司可能提前宣传 Gemini 4 系列模型。

来源:IT之家
来自频道: @DNSPODT
大型银行对使用中国人工智能模型表现出了令人惊讶的意愿

Amp 联合创始人兼首席执行官 Quinn Slack 表示:“我们实际上看到,即使是大型银行,对中国模型的接受度也相当高,因为他们知道自己需要掌握这些技术以备不时之需。”

来源:The Information
来自频道: @DNSPODT
Anthropic 为 Claude 生成内容加入机器可读水印

Anthropic 发布说明,宣布开始为 Claude 生成内容加入机器可读标记,以履行欧盟《AI 法案》第 50(2) 条“AI 生成内容透明度实践准则”相关承诺。欧盟相关透明度义务已于 2026 年 8 月 2 日开始适用。

对于 2026 年 8 月 2 日及之后在欧盟推出的新 Claude 模型,Anthropic 将从模型发布之日起提供标记能力。文本输出会嵌入肉眼不可见的水印;Claude 生成的 SVG、PNG、JPG 等受支持文件,则会加入基于 C2PA 开放标准的数字签名来源元数据。

文本水印直接作用于模型生成文本,因此复制粘贴后仍可能保留,并覆盖 Claude、Claude API、Claude Code、Claude Cowork、Claude Tag 等产品。对于受支持模型,这一机制并不只限于欧盟,而是计划在全球 Claude 服务范围内应用;通过 AWS、Google Cloud 与 Microsoft Foundry 调用时,也将应用文本水印。

Anthropic 同时表示,将向用户和第三方提供检测 Claude 标记的方法,但具体检测机制和技术文档目前尚未公布。2026 年 8 月 2 日之前发布的旧模型也计划逐步加入相关能力。

Anthropic 特别强调,这套机制并不能直接判断一段内容“是不是 Claude 写的”。检测到水印只能说明内容可能经过 Claude 处理,例如翻译、润色和摘要同样可能留下标记;反过来,没有检测到标记也不能证明内容由人类创作,因为大量改写、翻译、文本过短或文件元数据被移除,都可能使标记失效。

来源:Anthropic Claude Help Center
来自频道: @DNSPODT
来自频道: @DNSPODT
Anthropic 当地时间 10 日宣布,其今年 6 月末推出的 Claude Sonnet 5 人工智能模型未来将永久性维持首发期推广优惠价,原定 9 月 1 日生效的原价已被取消。

Claude Sonnet 5 的当前价格为每百万 Token(词元)输入 2 美元、每百万 Token(词元)输出 10 美元。此前计划实施的“原价”为 3 美元 / 15 美元,即上涨 50%。

来源:Claude
来自频道: @DNSPODT