与 K2 相比,K3 的层数从 61 层增加到 93 层,总参数量从 1.04 万亿增加到 2.78 万亿,激活参数从 326 亿增加到 1042 亿。路由专家数量由 384 个增加到 896 个,每个 Token 激活的专家数量由 8 个增加到 16 个,共享专家由 1 个增加到 2 个,注意力头则从 64 个增加到 96 个。
K3 的隐藏层维度仍然保持在 7168,没有通过继续扩大模型宽度来完成扩展。它主要增加了网络深度、专家数量和每个 Token 实际调用的专家容量。这意味着“2.8 万亿参数”代表模型可容纳的总体参数规模,而不是每次推理都需要执行全部参数。每个 Token 实际运行的是约 1042 亿参数,但这一激活规模本身仍然相当于一个大型稠密模型。
Kimi K3 的注意力结构采用 Kimi Delta Attention 与 Gated MLA 混合设计。每个主要模块由三层 KDA 和一层 Gated MLA 组成,完整模型共包含 69 层 KDA 和 24 层 MLA。KDA 使用固定大小的递归状态保存历史信息,避免像标准注意力一样为所有历史 Token 持续保存完整的键值缓存,主要负责处理长序列;MLA 则周期性执行全局注意力,保留任意 Token 之间的直接交互能力。
这意味着 K3 并不是一款完全依赖线性注意力的模型。KDA 可以控制百万上下文下的缓存增长,但 24 层 MLA 的缓存仍然会随着序列长度增加。K3 的设计更接近一种折中方案:多数层使用适合超长序列的递归注意力,少数层保留完整全局交互,以减少纯线性注意力在复杂信息检索和全局关联上的能力损失。
K3 的 MLA 层没有使用 RoPE 等显式位置编码,而是依赖前置 KDA 层产生的位置和时序信息。这样做可以避免扩展上下文时重新调整 RoPE 基频或执行位置插值。不过,百万 Token 能力并不是仅依靠 NoPE 自动获得的。K3 在训练中仍采用了分阶段上下文课程,窗口先从 8000 Token 扩展到 6.4 万 Token,随后在冷却训练阶段继续扩展到 25.6 万和 100 万 Token。
由于自然存在的百万 Token 高质量文档和视频数量有限,团队还合成了一批长上下文数据,将多个文档、图像和子任务重新组合,使答案必须依赖分散在完整上下文中的信息。报告强调,仅增加输入长度并不能让模型真正形成长距离能力,训练数据必须迫使模型跨越完整上下文进行检索和推理。
在模型深度方向,K3 引入了 Attention Residuals。传统残差连接会把此前所有层的信息持续压缩到同一个隐藏状态中,随着模型加深,早期信息可能被逐渐覆盖。Attention Residuals 把不同层的输出视为可以被后续层选择读取的信息源,让模型能够从嵌入层和此前模块中动态选择所需表示。
考虑到完整保存 93 层输出会带来较高内存和通信开销,K3 使用了分块版本的 Block Attention Residuals。模型将不同层划分为多个模块,模块内部先汇总信息,模块之间再执行选择性读取。这种设计试图在深层信息流和实际训练成本之间取得平衡。
在混合专家部分,K3 使用 Stable LatentMoE。模型共有 896 个路由专家,每个 Token 选择其中 16 个专家,同时保留两个全宽度共享专家。路由分支会先把 7168 维隐藏状态投影到 3584 维潜在空间,再执行专家计算,之后重新映射回完整隐藏维度。
这一设计降低了同时激活大量专家所需的通信量和权重读取成本,但也会引入训练稳定性问题。为此,K3 在专家聚合后增加 RMSNorm,并提出 SiTU-GLU 激活函数,对门控分支和上投影分支进行平滑限幅。按照报告给出的参数设置,单个输出坐标的理论幅度上限为 100,用于减少超大激活值和低精度计算溢出的风险。
团队还提出 Quantile Balancing,用于解决近 900 个专家之间的负载不均衡问题。传统方法通常按照专家过载或闲置情况,以固定步长逐渐修正路由偏置。Quantile Balancing 则根据全局路由分数的分位数直接计算下一步偏置,使每个专家接收的 Token 数尽量接近目标负载。
对于大规模 MoE 模型,专家负载平衡不仅影响模型训练,还直接决定集群利用率。只要部分专家持续过载,其他 GPU 就可能等待最慢的设备完成计算。K3 使用全局直方图近似计算分位数,从而避免收集数百万 Token 的完整路由分数,同时保持较低的通信成本。
报告称,架构、训练数据、优化器和训练配方的联合改进,使 K3 相比 K2 获得约 2.5 倍的整体扩展效率。这里的“2.5 倍”指的是在验证损失与训练计算量的拟合曲线上,达到相近验证损失所需的计算量有所下降,并不代表 K3 的推理速度比 K2 快 2.5 倍,也不意味着所有下游任务的单位成本都提高了相同比例。
这项结果还是多种改动共同产生的,包括 KDA、Attention Residuals、Stable LatentMoE、训练数据调整、Per-Head Muon 优化器以及超参数重新搜索。报告没有提供足够完整的逐项消融实验,因此目前无法明确判断每项技术分别贡献了多少。
Kimi K3 同时是一款原生多模态模型。其视觉编码器 MoonViT-V2 共有 27 层,参数量约为 4.01 亿。与先训练语言模型、再连接一个已经完成对比学习的视觉编码器不同,MoonViT-V2 从头开始参与统一的下一 Token 预测训练,文本、图像和视频数据共同进入同一个模型骨干。
团队表示,使用 SigLIP 初始化的视觉编码器在联合训练中出现了更高且更频繁的梯度尖峰,而从头训练的 MoonViT-V2 更加稳定,并在视觉评测中取得相近结果。K3 的图像和视频使用同一套视觉参数,视频注意力被拆分为空间和时间两个方向。模型还通过像素重排,将视觉 Token 数量缩减到原来的四分之一,最高可处理 3584×3584 分辨率的输入。
K3 的后训练过程由监督微调、强化学习和多教师在线蒸馏组成。团队分别在通用任务、通用智能体和编码智能体三个领域训练策略,每个领域再训练 low、high 和 max 三种推理强度,总计形成九个教师模型,最后通过 Multi-Teacher On-Policy Distillation 合并到一个统一模型中。
不同推理强度并不是简单调整最大输出长度。训练系统会根据冷启动模型为每个问题估计基础预算,超过预算的轨迹会受到负奖励。团队先训练预算较高的 max 模型,再逐步压缩预算,得到 high 和 low 版本。因此,不同推理强度在一定程度上代表经过强化学习形成的不同行为策略,而不只是服务端设置的 Token 上限。
为了训练持续数百甚至数千次工具调用的智能体任务,K3 使用了部分轨迹生成机制。系统不再等待所有强化学习轨迹全部结束,而是在一定比例的任务完成后先开始更新模型,其余任务暂停并在后续训练迭代中继续执行。一条超长任务可以跨越多个训练周期,代价是部分数据会变得陈旧,因此训练算法会限制每次策略更新幅度。
K3 的强化学习环境没有绑定单一智能体框架。团队将工具接口、系统提示、上下文管理、记忆、技能和子智能体等能力拆分成可组合模块,可以模拟 Kimi Code、Claude Code、Codex、OpenClaw 和 Hermes 等不同运行方式。这样做的目的,是减少模型对特定工具名称、提示格式和上下文压缩方法的依赖。
训练任务覆盖复杂搜索、专业知识工作、软件工程、GPU 内核优化、网页开发、视觉推理、长期个人助理和自主执行任务。个人助理环境模拟了 Gmail、Notion、Slack 和 Canvas 等应用,一条轨迹可以跨越多个模拟日期,包含数千次工具调用和数百万累计上下文 Token。
K3 的基础设施部分是技术报告中信息最集中的内容之一。团队为 KDA 开发了 FlashKDA 内核和 KDA Context Parallelism,将长序列拆分到不同设备,同时只交换固定大小的递归状态,而不是随上下文长度增长的完整键值块。
MoE 训练则使用 MoonEP 动态复制少量专家,使每个专家并行设备接收完全相同数量的 Token。负载固定后,专家计算可以使用静态形状,减少主机同步和内存碎片,并实现更直接的零拷贝通信。团队还通过激活量化、重新计算、CPU 卸载、跨流水线设备远程卸载等方式,控制 2.8 万亿参数模型的训练内存。
面向百万 Token 智能体强化学习,团队开发了基于 Firecracker microVM 的 AgentENV。该系统支持暂停、恢复、分叉和快照,最低检查点延迟约为 133 毫秒,恢复延迟约为 49 毫秒。报告称,在 K3 的训练和评估过程中,共创建了超过 5100 万个沙箱,涉及约 150 万种环境镜像。
在线推理方面,K3 必须同时管理 KDA 固定状态和 MLA 键值缓存。团队将两类缓存放入统一的分页存储池,并把物理缓存块与前缀哈希粒度分离。即使物理块包含数千 Token,前缀仍可以按 512 Token 边界复用,从而减少长对话和编码任务中重复执行前缀计算的成本。
K3 从监督微调阶段开始对 MoE 专家权重执行 MXFP4 量化感知训练,专家输入激活使用 MXFP8,注意力、共享专家和路由器等模块则保持更高精度。强化学习生成和训练使用相同的量化方式,以减少训练和实际部署之间的精度差异。预训练中的多 Token 预测层还被改造成 EAGLE-3 风格的草稿模型,用于推测解码加速。
来自频道: @DNSPODT
中国开始量产国产 DUV 芯片制造工具,本土芯片产业迎来突破
The Information报道称,一家中国国资背景的企业已开始制造 DUV 光刻机。这家总部位于上海的公司整合了来自其他中国企业的浸没式 DUV 研发团队,其中包括国资背景的初创企业上海宇量昇科技有限公司。
这家上海公司计划今年制造约五台DUV光刻机,并在2027年生产约20台。知情人士称,这些DUV系统计划于今年交付给中国本土芯片制造商,包括中芯国际、华虹半导体和存储芯片制造商长鑫存储。
▎Source
The Information报道称,一家中国国资背景的企业已开始制造 DUV 光刻机。这家总部位于上海的公司整合了来自其他中国企业的浸没式 DUV 研发团队,其中包括国资背景的初创企业上海宇量昇科技有限公司。
这家上海公司计划今年制造约五台DUV光刻机,并在2027年生产约20台。知情人士称,这些DUV系统计划于今年交付给中国本土芯片制造商,包括中芯国际、华虹半导体和存储芯片制造商长鑫存储。
▎Source
来自频道: @DNSPODT
月之暗面正式发布 Kimi K3 模型权重
月之暗面已在 Hugging Face 正式发布 Kimi K3 的完整模型权重,兑现了此前“最晚于 7 月 27 日开放权重”的承诺。配套的模型代码、技术报告和部署说明也已同步公开。
Kimi K3 采用混合专家架构,总参数量为 2.8 万亿,每次推理激活约 1040 亿参数。模型包含 896 个专家,每个 Token 选择其中 16 个专家,支持最高 100 万 Token 上下文,并具备原生图像理解能力。官方发布的是经过量化感知训练的 MXFP4 权重,Hugging Face 仓库总体积约为 1.56 TB。
官方目前推荐通过 vLLM、SGLang 或 TokenSpeed 部署 Kimi K3。由于模型规模较大,月之暗面建议使用包含至少 64 个加速器的超节点配置,这意味着个人用户和普通工作站基本无法直接运行完整模型。
Kimi K3 采用专门制定的 Kimi K3 License,而非 MIT、Apache 2.0 等常见开源许可证。该许可证允许使用、修改、微调、部署和分发模型,但对规模较大的模型服务商设置了额外商业条款。例如,相关企业连续 12 个月总收入超过 2000 万美元时,使用 Kimi K3 提供模型服务需要与月之暗面另行签订协议。
来源
月之暗面已在 Hugging Face 正式发布 Kimi K3 的完整模型权重,兑现了此前“最晚于 7 月 27 日开放权重”的承诺。配套的模型代码、技术报告和部署说明也已同步公开。
Kimi K3 采用混合专家架构,总参数量为 2.8 万亿,每次推理激活约 1040 亿参数。模型包含 896 个专家,每个 Token 选择其中 16 个专家,支持最高 100 万 Token 上下文,并具备原生图像理解能力。官方发布的是经过量化感知训练的 MXFP4 权重,Hugging Face 仓库总体积约为 1.56 TB。
官方目前推荐通过 vLLM、SGLang 或 TokenSpeed 部署 Kimi K3。由于模型规模较大,月之暗面建议使用包含至少 64 个加速器的超节点配置,这意味着个人用户和普通工作站基本无法直接运行完整模型。
Kimi K3 采用专门制定的 Kimi K3 License,而非 MIT、Apache 2.0 等常见开源许可证。该许可证允许使用、修改、微调、部署和分发模型,但对规模较大的模型服务商设置了额外商业条款。例如,相关企业连续 12 个月总收入超过 2000 万美元时,使用 Kimi K3 提供模型服务需要与月之暗面另行签订协议。
来源
来自频道: @DNSPODT
LoopDNS: 一例伪装成 Ren'Py 应用的多阶段恶意加载器调查
2026 年 7 月 24 日,LoopDNS 安全团队收到用户提交的一份可疑压缩包。样本外观上是一套结构完整的 Ren'Py Windows 程序,用户可见入口为
IOC内容如下:
完整攻击链、技术细节请阅读完整文章
阅读全文
2026 年 7 月 24 日,LoopDNS 安全团队收到用户提交的一份可疑压缩包。样本外观上是一套结构完整的 Ren'Py Windows 程序,用户可见入口为
Setup.exe,但其真实执行逻辑被隐藏在 Ren'Py 数据归档、加密配置文件、MSBuild 项目及后续 .NET 程序集中。IOC内容如下:
pingcircle[.]click
analyticstrack-pzh[.]click
analyticstrack-api[.]click
193.24.123[.]193
trusaifi[.]cfd
digoamji[.]shop
/assets/GlacifySingey.json
0x328A1faDff154290F0Ce1389a4E633698CDfdAa7
0x11E18d4E47c1c2ea4137262c3EFba9123Fd76b39
0x06fdde03
T_T825_eb45_g1_12
0wcM2_-TYfywDALCZexDOApg
LtrFwYbnytDv1
GentilWokasor
980a0ab9b888df0fedcf2c8cdd175e4b97488fddbcb6713234c09d2ec5f978c1
完整攻击链、技术细节请阅读完整文章
阅读全文
来自频道: @DNSPODT
giffgaff疑似集中清退长期境外用户,部分号码被直接停用
北京时间7月27日16时左右,有giffgaff用户反映收到官方发送的服务终止邮件。邮件称,平台在审查账户使用情况后,认定相关号码存在长期或永久在英国境外使用的情况,因此决定终止该号码的移动通信服务。
此次受影响的是否为大批量用户、涉及哪些国家和地区,目前仍有待进一步确认。
根据用户收到的邮件,giffgaff表示:
北京时间7月27日16时左右,有giffgaff用户反映收到官方发送的服务终止邮件。邮件称,平台在审查账户使用情况后,认定相关号码存在长期或永久在英国境外使用的情况,因此决定终止该号码的移动通信服务。
此次受影响的是否为大批量用户、涉及哪些国家和地区,目前仍有待进一步确认。
根据用户收到的邮件,giffgaff表示:
Hi xxxx,
We need to make you aware that, following a review of your account usage, we have made the decision to disconnect your service (mobile number ending xxx). In line with our terms and conditions, our services are intended primarily for use within the UK, with roaming provided for short-term travel only. As your usage pattern suggests extended or permanent use outside the UK, your account no longer meets the eligibility requirements for the service. As a result, your service will be disconnected shortly, and any associated access will cease.
Please note this is our final position on this matter.
We appreciate your understanding and thank you for your previous custom.
The giffgaff team
来自频道: @DNSPODT
腾讯宣布“QQ宠物”正式回归
腾讯旗下手机QQ正式上线全新升级的“QQ宠物”功能。升级后的QQ宠物采用3D立体形象,保留了喂食、洗澡、打工等经典玩法,并融入腾讯混元(Hy3)大模型技术,使宠物具备多种性格及交互能力。
此外,宠物可贯穿聊天列表等多个QQ应用场景,并新增好友串门互动等社交功能。用户可在手机QQ搜索“QQ宠物”体验并领取。
来源:腾讯QQ
腾讯旗下手机QQ正式上线全新升级的“QQ宠物”功能。升级后的QQ宠物采用3D立体形象,保留了喂食、洗澡、打工等经典玩法,并融入腾讯混元(Hy3)大模型技术,使宠物具备多种性格及交互能力。
此外,宠物可贯穿聊天列表等多个QQ应用场景,并新增好友串门互动等社交功能。用户可在手机QQ搜索“QQ宠物”体验并领取。
来源:腾讯QQ
来自频道: @DNSPODT
长鑫科技上市首日股价大涨 交易一度短暂卡顿
7月27日,国产存储龙头长鑫科技正式上市交易,首日开盘高开471.59%,报49.50元/股,总市值达3.31万亿元。开盘不久后,因交易量过大,部分投资者反映交易一度出现卡顿、无法撤单等情况,随后交易陆续恢复正常。
来源:第一财经
7月27日,国产存储龙头长鑫科技正式上市交易,首日开盘高开471.59%,报49.50元/股,总市值达3.31万亿元。开盘不久后,因交易量过大,部分投资者反映交易一度出现卡顿、无法撤单等情况,随后交易陆续恢复正常。
来源:第一财经
来自频道: @DNSPODT
英伟达拟为OpenAI提供2500亿美元融资担保 用于建设超大型数据中心
据媒体报道,英伟达正与OpenAI洽谈提供约2500亿美元的融资担保,以支持后者租用位于美国俄亥俄州南部的10GW级数据中心项目。该项目由软银旗下能源公司推进,若计入芯片等设施成本,总投资预计将超5000亿美元,有望成为全球规划规模最大的数据中心。
据悉,该项目由日本方面资金支持并涉及美国政府电力管理,OpenAI已展开深入谈判。此外,微软、谷歌等企业亦对该项目表达了兴趣。截至目前,英伟达与OpenAI尚未对此置评。
来源:WSJ
据媒体报道,英伟达正与OpenAI洽谈提供约2500亿美元的融资担保,以支持后者租用位于美国俄亥俄州南部的10GW级数据中心项目。该项目由软银旗下能源公司推进,若计入芯片等设施成本,总投资预计将超5000亿美元,有望成为全球规划规模最大的数据中心。
据悉,该项目由日本方面资金支持并涉及美国政府电力管理,OpenAI已展开深入谈判。此外,微软、谷歌等企业亦对该项目表达了兴趣。截至目前,英伟达与OpenAI尚未对此置评。
来源:WSJ
来自频道: @DNSPODT
针对近日网络上关于我院研究人员仇某某发表的相关医学研究论文,以及附属新华医院开展的一例临床研究的相关报道,医学院高度重视,已成立专项工作组,对事件进行全面调查。
医学院历来重视科研诚信和科研规范,坚决反对违背科研伦理违规开展医学科学研究。
医学院将根据调查情况严肃处理,感谢社会各界的关心与监督。
消息来源: 上海交通大学医学院
来自频道: @DNSPODT
微软调整了位于土耳其的OneDrive 家庭版订阅价格,由23.99try涨至409.99try。
值得一提的是,此前其他能够订阅365的app已经涨至该价格,只有OneDrive的家庭计划一直没有调整,现在调整貌似也不奇怪,只能说享受了这么久也不亏。
已经订阅的用户通常还能以原价格续订一次,并会在下个计费周期之前收到涨价邮件。
#微软 #订阅
来自频道: @DNSPODT
事件时间线完整还原
1. 7月24日19:40 国泰CX337北京首都起飞,滑入跑道等待起飞;
2. 19:48 机组接到地面指令,终止起飞滑回停机位,广播无法说明原因;
3. 20:10 航班停稳在停机坪,等待地面执法人员登机;
4. 21:40 办案人员进入经济舱,传唤徐进本人,其随行女性及行李同步被带下飞机(乘客仅目击这一幕);
5. 后续航班延误超2小时,最终于22:27起飞飞往香港,徐进本人未登机出境,留在北京接受审查。
简单总结:被立案审查、限制出境的是男性徐进,女士只是随行人员,并非本次事件核心当事人。
来自频道: @DNSPODT
美股富途内幕交易案追踪:财新证实被告宋文雷身份,涉案资金被锁定
据财新网报道,针对今年5月涉及富途等券商监管处罚消息披露前的巨额美股看跌期权内幕交易案,原告做市商海纳国际与城堡证券已在纽约提起诉讼并冻结相关盈利。此前法院公布的被告之一自然人“Wenlei Song”,现已确认身份为曾任职于中信证券、现居澳大利亚的投资者宋文雷,并非此前外界推测的同名中信建投前高管。
此外,案件目前已出现第三名被告杨敬尧,家庭背景及投资履历同样显赫。由于被告方申请,相关听证会现已延期。原告表示,随着更多匿名交易账户信息的解锁,后续还将追加更多起诉对象。
来源:财新 2
据财新网报道,针对今年5月涉及富途等券商监管处罚消息披露前的巨额美股看跌期权内幕交易案,原告做市商海纳国际与城堡证券已在纽约提起诉讼并冻结相关盈利。此前法院公布的被告之一自然人“Wenlei Song”,现已确认身份为曾任职于中信证券、现居澳大利亚的投资者宋文雷,并非此前外界推测的同名中信建投前高管。
此外,案件目前已出现第三名被告杨敬尧,家庭背景及投资履历同样显赫。由于被告方申请,相关听证会现已延期。原告表示,随着更多匿名交易账户信息的解锁,后续还将追加更多起诉对象。
来源:财新 2
来自频道: @DNSPODT
彭博:DeepSeek 已告知其第二轮融资的潜在投资者,目前将暂停这笔交易,知情人士透露。他们不会像预期那样在未来几天签署投资协议。
知情人士表示,DeepSeek 可能会选择在日后重启交易流程。此次暂停部分源于梁文锋对网上关于他在首轮融资中向投资者发表言论的报道感到不满,该轮融资于 6 月完成 ,为这家 AI 实验室筹集了 70 亿美元。
知情人士表示,DeepSeek 可能会选择在日后重启交易流程。此次暂停部分源于梁文锋对网上关于他在首轮融资中向投资者发表言论的报道感到不满,该轮融资于 6 月完成 ,为这家 AI 实验室筹集了 70 亿美元。
来自频道: @DNSPODT
7月24日19时,峰学蔚来总经理武亮发文:“住院的时候我甚至都没带换洗的内裤……因为所有人都说没事的,小手术小手术,结果做了五个小时,出来后看到这个照片才发现,干眼症就算麻醉情况下眼睛也是闭不住!手术一切顺利,等于生了个孩子一样。关于公司的事情,我能顺畅说话后会给大家回答关心的种种问题,时间会证明一切。”
来自频道: @DNSPODT
