7月18日2026 · 星期六

从 25 条抓取中筛选 12 条 · twitter × 5 账号 · 02:18 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. Kimi K3 实现接近前沿的智能体性能,计划开源权重9.0
  2. 月之暗面提出替代Transformer三大基础组件:Adam、注意力与残差连接9.0
  3. OpenAI的GPT-5.6 Sol在网络安全靶场达到最先进水平9.0
  4. OpenAI 确认 GPT-5.6 在完全访问模式下存在删除用户主目录的漏洞8.0
  5. AI视频创作需要人类专业能力,而非仅靠工具7.0
  6. Kimi K3 对比 Claude Fable 5:3D 建模更便宜但更慢7.0
  7. Qwen3-ASR在字幕转录中优于Whisper,时间戳更准且语言支持更好7.0
  8. 商汤开源信息图神器SenseNova U1 V3,新增AI图像编辑能力7.0
  9. GitHub仓库收录500+个AI/ML项目代码资源7.0
  10. SideScreen 将安卓平板变成 Mac 的低延迟第二显示器7.0
  11. 早期原型设计可节省AI开发中的token消耗7.0
  12. 开源项目用国产百元手柄替代 Codex Micro 控制器6.0
019.0

Kimi K3 实现接近前沿的智能体性能,计划开源权重

月之暗面(Moonshot AI)的 Kimi K3 在 Artificial Analysis 智能指数上获得 57 分,与 Claude Opus 4.8 和 GPT-5.5 等顶级闭源模型相当。该模型在 GDPval v2 上取得 1668 的 Elo 评分,在 AutomationBench-AA 上获得 53% 的成绩并排名第一。月之暗面计划开源其 2.8 万亿参数权重,这将使其成为领先的开源权重模型。 Kimi K3 的表现证明开源权重模型在复杂智能体任务上可以与闭源系统竞争,有望加速开源 AI 的采用。计划中的权重开源将使前沿 AI 能力民主化,让研究人员和开发者能够基于接近最前沿的模型进行构建。它在真实工作流基准测试中的强劲表现,预示着其对企业自动化的实际价值。 Kimi K3 拥有 2.8 万亿参数、1M 上下文窗口,并支持原生多模态输入(文本和图像)。其 API 定价为每百万输入/输出 tokens 3/15 美元,缓存输入可享受 90% 折扣。该模型比前代 K2.6 少用了 21% 的输出 tokens,同时取得了更高分数,且每次任务成本(0.94 美元)与 GPT-5.6 Sol(1.04 美元)相当。权重尚未发布,但已计划开源。

@ArtificialAnlys@Kimi_Moonshot 转推1 张图片Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.8 and GPT-5.5 but remains behind Fable 5 and GPT-5.6 Sol. Moonshot AI has expressed plans to release the 2.8T parameter model's weights, which would make it the leading open weights model Key results: ➤ Strong agentic task performance: @Kimi_Moonshot's Kimi K3 reaches an Elo rating of 1668 on GDPval v2. This is a marked improvement over K2.6’s 1190, surpassing GLM-5.2 (1514), GPT-5.5 (1494), and Claude Opus 4.8 (1600). However, it still lags behind Claude Fable 5 (1760). Kimi K3 also scores an impressive 53% and takes the #1 position on AutomationBench-AA, our implementation of Zapier’s Agentic SaaS workflow evaluation. ➤ Second-highest performance on AA-Briefcase (agentic knowledge work): On our private long-horizon knowledge work evaluation, Kimi K3 reaches an overall Elo of 1547, +732 points from Kimi K2.6 and behind only Claude Fable 5. It is well-rounded: its rubric scoring and analytical quality almost reach Claude Fable 5’s scores, while GPT-5.6 Sol continues to outperform other leading models on presentation quality. ➤ Set to lead open weights models once weights are released: Moonshot AI has not yet released the weights but expressed plans to do so. Once available, Kimi K3 would clearly lead other open weights models including GLM-5.2 (51) and DeepSeek v4 Pro (44). However, at 2.8T parameters, it is significantly larger than its open weights peers (eg. GLM-5.2 at 753B params and DeepSeek V4 Pro at 1.6T), as well as the Kimi K2 to K2.6 models (1T params). ➤ Cost per task ($0.94) is similar to GPT-5.6 Sol ($1.04), ~1/2 the price of Opus 4.8 ($1.80) and higher than open weights peers: Moonshot AI’s pricing for K3 is significantly higher than their K2 pricing (K3’s output token price is $15/1M tokens while K2.6 was $4). This positions the model as cheaper on a cost per task basis than Opus 4.8, similar to GPT-5.6 Sol ($1.04) and more expensive than open weights peers, GLM-5.2 ($0.32) and DeepSeek V4 Pro ($0.04) ➤ Improved token efficiency alongside higher intelligence: Kimi K3’s token usage on the Artificial Analysis Intelligence Index decreased significantly, using 21% fewer output tokens than K2.6. The new model used approximately 132M output tokens to complete all nine evaluations, compared to approximately 166M for K2.6, while achieving higher scores. ➤ Native multimodal capabilities: Kimi K3, like K2.6, is released with native image and text multimodal input. If weights are released, this will position Kimi K3 as one of the leading open weights models with multimodal input capabilities Other model details: Context window: 1M Size: 2.8T total parameters Pricing: The first-party API is priced at $3.00/$15.00 per 1M input/output tokens, with cached input discounted 90% to $0.30 per 1M tokens. Modality: Native multimodal input supports text and images, and the model remains text-only for output. Accessibility: Accessible at launch through Moonshot’s first party API. Model weights are not yet released but Moonshot AI has expressed plans to do so.原推文媒体预览展开原推文收起原推文

@Kimi_Moonshot 转推了

@ArtificialAnlys

Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.8 and GPT-5.5 but remains behind Fable 5 and GPT-5.6 Sol. Moonshot AI has expressed plans to release the 2.8T parameter model's weights, which would make it the leading open weights model Key results: ➤ Strong agentic task performance: @Kimi_Moonshot's Kimi K3 reaches an Elo rating of 1668 on GDPval v2. This is a marked improvement over K2.6’s 1190, surpassing GLM-5.2 (1514), GPT-5.5 (1494), and Claude Opus 4.8 (1600). However, it still lags behind Claude Fable 5 (1760). Kimi K3 also scores an impressive 53% and takes the #1 position on AutomationBench-AA, our implementation of Zapier’s Agentic SaaS workflow evaluation. ➤ Second-highest performance on AA-Briefcase (agentic knowledge work): On our private long-horizon knowledge work evaluation, Kimi K3 reaches an overall Elo of 1547, +732 points from Kimi K2.6 and behind only Claude Fable 5. It is well-rounded: its rubric scoring and analytical quality almost reach Claude Fable 5’s scores, while GPT-5.6 Sol continues to outperform other leading models on presentation quality. ➤ Set to lead open weights models once weights are released: Moonshot AI has not yet released the weights but expressed plans to do so. Once available, Kimi K3 would clearly lead other open weights models including GLM-5.2 (51) and DeepSeek v4 Pro (44). However, at 2.8T parameters, it is significantly larger than its open weights peers (eg. GLM-5.2 at 753B params and DeepSeek V4 Pro at 1.6T), as well as the Kimi K2 to K2.6 models (1T params). ➤ Cost per task ($0.94) is similar to GPT-5.6 Sol ($1.04), ~1/2 the price of Opus 4.8 ($1.80) and higher than open weights peers: Moonshot AI’s pricing for K3 is significantly higher than their K2 pricing (K3’s output token price is $15/1M tokens while K2.6 was $4). This positions the model as cheaper on a cost per task basis than Opus 4.8, similar to GPT-5.6 Sol ($1.04) and more expensive than open weights peers, GLM-5.2 ($0.32) and DeepSeek V4 Pro ($0.04) ➤ Improved token efficiency alongside higher intelligence: Kimi K3’s token usage on the Artificial Analysis Intelligence Index decreased significantly, using 21% fewer output tokens than K2.6. The new model used approximately 132M output tokens to complete all nine evaluations, compared to approximately 166M for K2.6, while achieving higher scores. ➤ Native multimodal capabilities: Kimi K3, like K2.6, is released with native image and text multimodal input. If weights are released, this will position Kimi K3 as one of the leading open weights models with multimodal input capabilities Other model details: Context window: 1M Size: 2.8T total parameters Pricing: The first-party API is priced at $3.00/$15.00 per 1M input/output tokens, with cached input discounted 90% to $0.30 per 1M tokens. Modality: Native multimodal input supports text and images, and the model remains text-only for output. Accessibility: Accessible at launch through Moonshot’s first party API. Model weights are not yet released but Moonshot AI has expressed plans to do so.

背景
Artificial Analysis 智能指数是一个综合基准,评估 AI 模型在数学、科学、编程和推理方面的能力。GDPval v2 评估模型在多个职业中完成真实世界经济价值任务的表现。AutomationBench-AA 测试 AI 智能体在遵守业务规则的情况下自动化 SaaS 工作流的能力。开源权重模型允许任何人使用、修改和部署模型,与闭源 API 不同。
社区讨论
社区反应凸显了对 Kimi K3 开源计划的兴奋,以及其在 Next.js 评估中排名第一的成就,有人指出这是开源模型首次在该基准上超越闭源模型。但也有人谨慎表示,基准测试无法涵盖所有现实世界的细微差别,且模型规模较大可能限制个人开发者的使用。

7月17日 08:52在 X 打开#AI #open-source #large language model #agentic AI #benchmark

029.0

月之暗面提出替代Transformer三大基础组件:Adam、注意力与残差连接

在GTC 2026上,月之暗面创始人杨植麟展示了三个开源方案,分别替代Transformer中沿用近十年的基础组件:用MuonClip优化器替代Adam,用Kimi Linear注意力替代标准注意力,用Attention Residue架构替代残差连接。演讲还分享了Kimi K2.5模型的扩展经验,包括视觉与文本的早期融合训练,以及支持多智能体并行协作的Agent Swarm系统。 这些创新直击大语言模型训练的核心瓶颈:数据稀缺、长上下文效率与深度可扩展性。MuonClip通过提高数据利用效率并稳定万亿参数训练,有望降低算力成本,推动大规模AI研究的普及。新型注意力与残差机制可能成为下一代架构的基础,帮助开源模型缩小与闭源前沿的差距。 MuonClip基于Muon优化器,加入QK-Clip防止注意力logit爆炸,使万亿参数模型在15万亿token上稳定训练。Kimi Linear以3:1比例混合线性注意力(KDA)与全注意力,在短、长上下文任务中均优于全注意力。Attention Residue用可学习的注意力机制替代固定残差连接,允许每层从所有前序层中选取信息。Agent Swarm支持最多100个智能体并行(K2.6增至300个),采用动态奖励权重。K2.5的早期融合训练使视觉任务提升了文本推理能力,并在零视觉SFT数据下取得有竞争力的视觉表现。

@dotey引用推文2 个视频杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。 但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。 杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。 此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。 【一、数据不够,就让每个 Token 更值钱】 大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。 互联网上真正有价值的文本数量有限,模型越做越大,需要的数据越来越多,大家迟早都会撞上“数据墙”。既然高质量数据很难翻倍,月之暗面的思路是:能不能让模型从同样的数据里学到更多? 他们给出的答案是 MuonClip,用它替代已经用了十多年的 Adam 优化器。 MuonClip 基于 Muon 优化器。简单理解,它会在更新模型参数时,尽量让不同方向上的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。 月之暗面的实验结果是:使用同样数量的数据,MuonClip 的训练效果接近把数据量增加一倍,这不仅意味着训练成本下降,也意味着模型能力的上限可能被推高。 假设手里只有 50 万亿个高质量 Token,如果 Token 利用效率提高一倍,就相当于又多出了 50 万亿 Token。在优质数据越来越稀缺的情况下,这种效率提升比单纯增加算力更重要。 但 Muon 也有一个明显问题:模型扩展到万亿参数后,注意力层里的数值容易失控。 月之暗面在训练中发现,注意力层的最大 logit 会突然飙升到 1000 以上,而正常范围通常只有 50 到 100。一旦数值继续膨胀,训练曲线就会发散,整个训练过程可能直接崩掉。 为了解决这个问题,他们设计了 QK-Clip。它会在模型前向计算时,实时检查每个注意力头的最大 logit。一旦数值超过安全范围,就同步缩放 Q 和 K 的投影,把数值压回来。 这个操作不会改变训练的收敛效果,只负责维持数值稳定。 靠着 QK-Clip,月之暗面成功把 Muon 扩展到了万亿参数规模,并训练了超过 15 万亿 Token,整个过程中没有出现一次 loss spike。 【二、上下文不只是要长,还要真正有用】 第二个方向,是提高模型利用长上下文的能力。 杨植麟展示了 Scaling Law 论文作者 Jared Kaplan 等人曾经做过的一组实验:比较 Transformer 和 LSTM 在不同上下文长度下的预测效果。 LSTM 读到一定长度之后,效果很快就不再提升。继续增加上下文,模型也很难从中获得更多信息。Transformer 则不同。上下文越长,模型对后续内容的预测通常越准确,而且很难看到明显的饱和点。 这个特点在 Agent 时代尤其重要。复杂 Agent 任务可能持续几天甚至几周。模型需要记住之前做过什么、得到过哪些结果、哪些方向已经失败,以及接下来该做什么。如果长上下文不能持续提供有效信息,Agent 的任务链条就很容易断掉。 问题是,标准的全注意力机制成本太高。它的计算量会随着上下文长度平方增长。上下文扩大十倍,注意力计算量可能增加一百倍。到了百万 Token 级别,训练和推理成本都会变得非常高。 月之暗面的解决方案是 Kimi Linear,核心是一种名为 KDA,也就是 Kimi Delta Attention 的线性注意力机制。KDA 的关键,是让模型学会“哪些信息要长期保留,哪些信息可以快速忘掉”。 传统线性注意力通常只有一个全局衰减系数,控制整个模型的记忆速度。这有点像所有内容共用同一个遗忘按钮:要么一起记住,要么一起忘掉。KDA 把一个衰减系数拆成了多个。不同信息通道可以使用不同的遗忘速度: - 有些通道衰减得很慢,负责保留长距离信息 - 有些通道衰减得很快,及时腾出空间吸收新内容 实际使用时,Kimi Linear 并没有完全抛弃全注意力,而是把线性注意力层和全注意力层按照 3∶1 的比例混合。 杨植麟称,这是第一个在短上下文、长输入和长输出任务上,都能全面超过全注意力的架构。上下文扩展到百万 Token,甚至更长时,它的效率优势会更加明显。 【三、从一个 Agent,变成一支 Agent 团队】 前两个方向都在提升单个模型的能力。第三个方向,则是让多个 Agent 一起工作。月之暗面把这种方式叫作 Agent Swarm,也就是“智能体集群”。 它的组织方式很像一家公司。一个主 Agent 充当 CEO,负责理解目标、拆解任务,并把不同子任务分配给多个子 Agent。子 Agent 可以分别扮演研究员、程序员、数据分析师和事实核查员等角色。任务完成后,主 Agent 再汇总结果。 这样做最大的价值是把串行任务改成并行任务。过去,一个 Agent 可能需要依次搜索资料、阅读文档、分析数据、编写代码、检查事实。现在,这些工作可以交给几十个甚至几百个 Agent 同时完成,从而大幅缩短复杂任务的执行时间。 不过,要让模型真正学会并行协作并不容易。训练 Agent Swarm 时,月之暗面设计了三种奖励: 第一种是“实例化奖励”,鼓励主 Agent 创建更多可以并行执行的子任务,避免它退化回单 Agent 串行工作。 第二种是“完成奖励”,要求子任务必须真正完成,防止模型为了获得实例化奖励,批量创建没有意义的空任务。 第三种是最终结果奖励,用来判断整个任务是否真正解决。 这三种奖励的权重会随着训练过程动态变化。训练前期更重视任务拆解、并行化和子任务完成率,后期则逐渐把重点转向最终结果。 从演示结果看,Agent Swarm 在复杂任务上能明显缩短执行时间。比如: - 同时下载、阅读几百个信息源并完成研究 - 并行撰写一份上百页文献综述的不同章节 - 同时分析十个不同的数据集 Kimi K2.5 发布时,Agent Swarm 已经支持最多 100 个 Agent 并行工作,整个任务最多可以执行 1500 个步骤。4 月发布的 K2.6 又把并行 Agent 的上限提高到了 300 个。 【四、一个意外收获:练“视觉”,也能让“大脑”变聪明】 K2.5 和前代 K2 之间,一个重要变化是采用了“早期融合”训练。 过去很多开源多模态模型采用的是“后期融合”:先用大量文本训练出一个语言模型,再用相对少量的视觉数据补上看图能力。 例如,先训练 20 万亿个文本 Token,再用大约 2 万亿个多模态 Token 把视觉能力“贴”上去。 K2.5 的做法不同。 它从训练一开始,就把视觉和文本数据混在一起。在 K2 文本基座的基础上,K2.5 又训练了约 15 万亿个混合 Token。 这种方式带来了两个让杨植麟感到兴奋的结果。 第一个发现是:只训练视觉任务,也能提升模型的文本推理能力。 研究团队只让模型完成数数、识别图片和视觉问答等任务,没有加入数学或编程训练。结果模型的文本推理能力也变强了。 换句话说,模型在练习“看”的同时,“想”的能力也得到了提升。 第二个发现则来自相反的方向:如果文本基座足够强,模型甚至不一定需要专门的视觉 SFT 数据。 K2.5 采用了“零视觉 SFT”方案。所有监督微调数据都是纯文本,然后再通过文本与视觉联合的强化学习,让模型获得视觉能力。最终,它在视觉任务上的表现依然接近最先进水平。 杨植麟认为,这种双向迁移来自早期融合。 当文本和视觉被放进同一个表征空间后,一种模态学到的能力,就有机会迁移到另一种模态。这也是 K2.5 能够“看图写代码”的基础。 如果视觉和文本仍然像两个彼此分开的“大脑”,这样的跨模态能力就很难自然出现。 【五、下一步:用注意力机制替代残差连接】 演讲快结束时,杨植麟介绍了月之暗面刚刚发布的一项新研究:Attention Residue,也就是“注意力残差”。这篇论文发布于 3 月 15 日,距离演讲只有两天。 残差连接是现代深度神经网络最重要的基础技术之一。2015 年,何恺明等人提出残差网络,此后残差连接逐渐成为 Transformer 的标准组件。它的基本做法是:每一层不仅处理上一层的结果,还保留一条直接传递信息的通道。这样即使模型很深,信息和梯度也能顺利通过,模型才有可能稳定训练。 杨植麟引用了 Ilya Sutskever 的一个说法:残差连接可以被理解为“旋转了 90 度的 LSTM”——LSTM 在时间维度上传递信息,残差连接则在网络深度上传递信息。 月之暗面顺着这个类比继续往前走了一步。 既然 Transformer 已经用注意力机制替代了 LSTM 在时间维度上的循环结构,那么在深度维度上,是否也能做同样的替换? Attention Residue 就是这个思路的产物。 标准残差连接主要使用上一层的输出。Attention Residue 则允许当前层查看所有前序层的输出,再通过注意力机制决定:哪些历史信息值得保留,哪些信息可以忽略。 也就是说,模型不再只能被动接收上一层的结果,而是可以主动从整个计算历史中挑选信息。 为了控制计算成本,月之暗面实际采用的是分块版本 Block Attention Residual。它会把模型层分成多个块,比如每 16 层组成一个块。块内继续使用标准残差连接,块与块之间才使用注意力残差。 实验显示,大约 8 个块就能获得大部分收益。 Attention Residue 带来了约 24% 的 Token 效率提升。 按照杨植麟的算法,如果有 50 万亿个高质量 Token,效率提高 24%,就相当于额外增加了 12 万亿个 Token。它在 GPQA、MATH 和 HumanEval 等推理、数学与编程测试上的提升尤其明显。 【三个用了近十年的组件,都还有改进空间】 演讲最后,杨植麟把月之暗面的三个替代方案放在了一起: - Adam → MuonClip - Full Attention → Kimi Linear - Residual Connection → Attention Residue 它们分别对应大模型训练中的三个基础问题: - 怎样从有限的数据中学到更多 - 怎样更高效地利用超长上下文 - 怎样让深层网络更灵活地传递信息 三个方案都可以相对独立地替换现有组件,也都已经开源。 这些技术能否直接叠加,增益能否简单相乘,目前还没有经过完整验证。但它们至少说明了一件事:很多被认为“已经足够好”的基础组件,可能远没有到达终点。 在优质数据越来越少、训练成本越来越高的情况下,继续堆参数和算力并不是唯一的路。重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。 这也是杨植麟整场演讲真正想表达的观点。 正如他最后所说: > “Open models cannot be just open; they have also to be great.” 开源模型不能只是开放,还必须足够强。 注:本视频由 http://BaoCut.app 翻译原推文媒体预览+1展开原推文收起原推文

@dotey

杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。 但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。 杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。 此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。 【一、数据不够,就让每个 Token 更值钱】 大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。 互联网上真正有价值的文本数量有限,模型越做越大,需要的数据越来越多,大家迟早都会撞上“数据墙”。既然高质量数据很难翻倍,月之暗面的思路是:能不能让模型从同样的数据里学到更多? 他们给出的答案是 MuonClip,用它替代已经用了十多年的 Adam 优化器。 MuonClip 基于 Muon 优化器。简单理解,它会在更新模型参数时,尽量让不同方向上的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。 月之暗面的实验结果是:使用同样数量的数据,MuonClip 的训练效果接近把数据量增加一倍,这不仅意味着训练成本下降,也意味着模型能力的上限可能被推高。 假设手里只有 50 万亿个高质量 Token,如果 Token 利用效率提高一倍,就相当于又多出了 50 万亿 Token。在优质数据越来越稀缺的情况下,这种效率提升比单纯增加算力更重要。 但 Muon 也有一个明显问题:模型扩展到万亿参数后,注意力层里的数值容易失控。 月之暗面在训练中发现,注意力层的最大 logit 会突然飙升到 1000 以上,而正常范围通常只有 50 到 100。一旦数值继续膨胀,训练曲线就会发散,整个训练过程可能直接崩掉。 为了解决这个问题,他们设计了 QK-Clip。它会在模型前向计算时,实时检查每个注意力头的最大 logit。一旦数值超过安全范围,就同步缩放 Q 和 K 的投影,把数值压回来。 这个操作不会改变训练的收敛效果,只负责维持数值稳定。 靠着 QK-Clip,月之暗面成功把 Muon 扩展到了万亿参数规模,并训练了超过 15 万亿 Token,整个过程中没有出现一次 loss spike。 【二、上下文不只是要长,还要真正有用】 第二个方向,是提高模型利用长上下文的能力。 杨植麟展示了 Scaling Law 论文作者 Jared Kaplan 等人曾经做过的一组实验:比较 Transformer 和 LSTM 在不同上下文长度下的预测效果。 LSTM 读到一定长度之后,效果很快就不再提升。继续增加上下文,模型也很难从中获得更多信息。Transformer 则不同。上下文越长,模型对后续内容的预测通常越准确,而且很难看到明显的饱和点。 这个特点在 Agent 时代尤其重要。复杂 Agent 任务可能持续几天甚至几周。模型需要记住之前做过什么、得到过哪些结果、哪些方向已经失败,以及接下来该做什么。如果长上下文不能持续提供有效信息,Agent 的任务链条就很容易断掉。 问题是,标准的全注意力机制成本太高。它的计算量会随着上下文长度平方增长。上下文扩大十倍,注意力计算量可能增加一百倍。到了百万 Token 级别,训练和推理成本都会变得非常高。 月之暗面的解决方案是 Kimi Linear,核心是一种名为 KDA,也就是 Kimi Delta Attention 的线性注意力机制。KDA 的关键,是让模型学会“哪些信息要长期保留,哪些信息可以快速忘掉”。 传统线性注意力通常只有一个全局衰减系数,控制整个模型的记忆速度。这有点像所有内容共用同一个遗忘按钮:要么一起记住,要么一起忘掉。KDA 把一个衰减系数拆成了多个。不同信息通道可以使用不同的遗忘速度: - 有些通道衰减得很慢,负责保留长距离信息 - 有些通道衰减得很快,及时腾出空间吸收新内容 实际使用时,Kimi Linear 并没有完全抛弃全注意力,而是把线性注意力层和全注意力层按照 3∶1 的比例混合。 杨植麟称,这是第一个在短上下文、长输入和长输出任务上,都能全面超过全注意力的架构。上下文扩展到百万 Token,甚至更长时,它的效率优势会更加明显。 【三、从一个 Agent,变成一支 Agent 团队】 前两个方向都在提升单个模型的能力。第三个方向,则是让多个 Agent 一起工作。月之暗面把这种方式叫作 Agent Swarm,也就是“智能体集群”。 它的组织方式很像一家公司。一个主 Agent 充当 CEO,负责理解目标、拆解任务,并把不同子任务分配给多个子 Agent。子 Agent 可以分别扮演研究员、程序员、数据分析师和事实核查员等角色。任务完成后,主 Agent 再汇总结果。 这样做最大的价值是把串行任务改成并行任务。过去,一个 Agent 可能需要依次搜索资料、阅读文档、分析数据、编写代码、检查事实。现在,这些工作可以交给几十个甚至几百个 Agent 同时完成,从而大幅缩短复杂任务的执行时间。 不过,要让模型真正学会并行协作并不容易。训练 Agent Swarm 时,月之暗面设计了三种奖励: 第一种是“实例化奖励”,鼓励主 Agent 创建更多可以并行执行的子任务,避免它退化回单 Agent 串行工作。 第二种是“完成奖励”,要求子任务必须真正完成,防止模型为了获得实例化奖励,批量创建没有意义的空任务。 第三种是最终结果奖励,用来判断整个任务是否真正解决。 这三种奖励的权重会随着训练过程动态变化。训练前期更重视任务拆解、并行化和子任务完成率,后期则逐渐把重点转向最终结果。 从演示结果看,Agent Swarm 在复杂任务上能明显缩短执行时间。比如: - 同时下载、阅读几百个信息源并完成研究 - 并行撰写一份上百页文献综述的不同章节 - 同时分析十个不同的数据集 Kimi K2.5 发布时,Agent Swarm 已经支持最多 100 个 Agent 并行工作,整个任务最多可以执行 1500 个步骤。4 月发布的 K2.6 又把并行 Agent 的上限提高到了 300 个。 【四、一个意外收获:练“视觉”,也能让“大脑”变聪明】 K2.5 和前代 K2 之间,一个重要变化是采用了“早期融合”训练。 过去很多开源多模态模型采用的是“后期融合”:先用大量文本训练出一个语言模型,再用相对少量的视觉数据补上看图能力。 例如,先训练 20 万亿个文本 Token,再用大约 2 万亿个多模态 Token 把视觉能力“贴”上去。 K2.5 的做法不同。 它从训练一开始,就把视觉和文本数据混在一起。在 K2 文本基座的基础上,K2.5 又训练了约 15 万亿个混合 Token。 这种方式带来了两个让杨植麟感到兴奋的结果。 第一个发现是:只训练视觉任务,也能提升模型的文本推理能力。 研究团队只让模型完成数数、识别图片和视觉问答等任务,没有加入数学或编程训练。结果模型的文本推理能力也变强了。 换句话说,模型在练习“看”的同时,“想”的能力也得到了提升。 第二个发现则来自相反的方向:如果文本基座足够强,模型甚至不一定需要专门的视觉 SFT 数据。 K2.5 采用了“零视觉 SFT”方案。所有监督微调数据都是纯文本,然后再通过文本与视觉联合的强化学习,让模型获得视觉能力。最终,它在视觉任务上的表现依然接近最先进水平。 杨植麟认为,这种双向迁移来自早期融合。 当文本和视觉被放进同一个表征空间后,一种模态学到的能力,就有机会迁移到另一种模态。这也是 K2.5 能够“看图写代码”的基础。 如果视觉和文本仍然像两个彼此分开的“大脑”,这样的跨模态能力就很难自然出现。 【五、下一步:用注意力机制替代残差连接】 演讲快结束时,杨植麟介绍了月之暗面刚刚发布的一项新研究:Attention Residue,也就是“注意力残差”。这篇论文发布于 3 月 15 日,距离演讲只有两天。 残差连接是现代深度神经网络最重要的基础技术之一。2015 年,何恺明等人提出残差网络,此后残差连接逐渐成为 Transformer 的标准组件。它的基本做法是:每一层不仅处理上一层的结果,还保留一条直接传递信息的通道。这样即使模型很深,信息和梯度也能顺利通过,模型才有可能稳定训练。 杨植麟引用了 Ilya Sutskever 的一个说法:残差连接可以被理解为“旋转了 90 度的 LSTM”——LSTM 在时间维度上传递信息,残差连接则在网络深度上传递信息。 月之暗面顺着这个类比继续往前走了一步。 既然 Transformer 已经用注意力机制替代了 LSTM 在时间维度上的循环结构,那么在深度维度上,是否也能做同样的替换? Attention Residue 就是这个思路的产物。 标准残差连接主要使用上一层的输出。Attention Residue 则允许当前层查看所有前序层的输出,再通过注意力机制决定:哪些历史信息值得保留,哪些信息可以忽略。 也就是说,模型不再只能被动接收上一层的结果,而是可以主动从整个计算历史中挑选信息。 为了控制计算成本,月之暗面实际采用的是分块版本 Block Attention Residual。它会把模型层分成多个块,比如每 16 层组成一个块。块内继续使用标准残差连接,块与块之间才使用注意力残差。 实验显示,大约 8 个块就能获得大部分收益。 Attention Residue 带来了约 24% 的 Token 效率提升。 按照杨植麟的算法,如果有 50 万亿个高质量 Token,效率提高 24%,就相当于额外增加了 12 万亿个 Token。它在 GPQA、MATH 和 HumanEval 等推理、数学与编程测试上的提升尤其明显。 【三个用了近十年的组件,都还有改进空间】 演讲最后,杨植麟把月之暗面的三个替代方案放在了一起: - Adam → MuonClip - Full Attention → Kimi Linear - Residual Connection → Attention Residue 它们分别对应大模型训练中的三个基础问题: - 怎样从有限的数据中学到更多 - 怎样更高效地利用超长上下文 - 怎样让深层网络更灵活地传递信息 三个方案都可以相对独立地替换现有组件,也都已经开源。 这些技术能否直接叠加,增益能否简单相乘,目前还没有经过完整验证。但它们至少说明了一件事:很多被认为“已经足够好”的基础组件,可能远没有到达终点。 在优质数据越来越少、训练成本越来越高的情况下,继续堆参数和算力并不是唯一的路。重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。 这也是杨植麟整场演讲真正想表达的观点。 正如他最后所说: > “Open models cannot be just open; they have also to be great.” 开源模型不能只是开放,还必须足够强。 注:本视频由 http://BaoCut.app 翻译

@Jackywine

KIMI CEO杨植麟,一个视频带你彻底看懂大规模 AI 系统训练的秘密 自己看一遍比什么都重要

背景
Transformer是当前大语言模型的主流架构,其三大核心组件——Adam优化器(2014年)、多头自注意力机制(2017年)和残差连接(2015年)——近十年来基本未变。月之暗面的Kimi系列是旨在追赶闭源模型性能的开源模型。在NVIDIA GTC 2026的演讲中,杨植麟详细阐述了如何通过重新设计这些基础组件来突破扩展瓶颈。

7月17日 17:38在 X 打开#AI #LLM #Transformer #Optimization #Open Source

039.0

OpenAI的GPT-5.6 Sol在网络安全靶场达到最先进水平

OpenAI宣布GPT-5.6 Sol在“The Last Ones”网络安全靶场上达到了新的最先进水平。该模型的能力正转化为现实世界的防御成果,帮助团队发现、验证和修复代码中的漏洞。OpenAI还推出了Codex Security插件,将这些能力集成到Codex开发环境中,实现自动化安全扫描。 这一突破表明,先进的AI模型可以通过自动化漏洞检测和修复来显著增强网络安全防御。它可以减少保护软件所需的时间和专业知识,使开发团队更容易获得强大的安全保障。通过插件集成到Codex中,预示着向AI增强的安全工作流程转变,可能重塑组织处理应用安全的方式。 GPT-5.6 Sol是GPT-5.6模型家族的一部分,于2026年7月9日在ChatGPT、Codex和API中全面可用。在Artificial Analysis编码代理指数上,使用最大推理的GPT-5.6 Sol得分为80,比Fable 5高出2.8分,同时输出令牌使用量不到一半,成本降低约三分之一。Codex Security插件扫描授权的代码库,构建威胁模型,检查可达性并验证发现,充当自动化安全工程师。

@OpenAI串推 2 条2 段 · 5 张图片GPT-5.6 Sol sets a new state of the art in cybersecurity on “The Last Ones” cyber range. We’re already seeing that capability translate into defensive outcomes: helping teams find, validate, and fix vulnerabilities in real-world code. Put it to work with Codex Security: https://openai.com/daybreak/codex-security-plugin/#desktop-codex原推文媒体预览+4展开原推文收起原推文

@OpenAI串推 2 条

GPT-5.6 Sol sets a new state of the art in cybersecurity on “The Last Ones” cyber range. We’re already seeing that capability translate into defensive outcomes: helping teams find, validate, and fix vulnerabilities in real-world code. Put it to work with Codex Security: https://openai.com/daybreak/codex-security-plugin/#desktop-codex

Here's how to add the Codex Security plugin in Codex and get started: Add the plugin in Codex. After installation is complete, the button changes to “Try in chat.” Click “Try in chat” to start a new Codex chat with a Codex Security scan prompt ready to run. Choose a folder that contains the code you want Codex Security to review. Send the scan prompt. Codex opens with the Codex Security scan prompt ready. Press “Send” to start the scan.

背景
网络安全靶场是用于网络安全培训、模拟和技术开发的虚拟环境,规模从单个节点到类似互联网的网络不等。“The Last Ones”是一个特定的网络安全靶场,用于基准测试AI模型的网络安全能力。GPT-5.6是OpenAI语言模型的一代,Sol是为编码等复杂任务优化的最强变体。Codex是OpenAI的AI驱动开发环境,插件扩展其功能,例如用于自动漏洞扫描的Codex Security插件。

7月17日 22:21在 X 打开#AI #cybersecurity #OpenAI #GPT-5.6 #Codex

048.0

OpenAI 确认 GPT-5.6 在完全访问模式下存在删除用户主目录的漏洞

OpenAI 正式回应了 GPT-5.6 在 Codex 完全访问模式下(无沙盒或自动审查)可能意外删除用户整个主目录的问题。该漏洞源于模型试图覆盖 $HOME 环境变量以设置临时目录时,错误地删除了真正的 $HOME 目录。OpenAI 正在采取缓解措施,包括更新开发者提示信息、引导用户使用更安全的权限模式,以及在 Codex 的 Harness 中增加额外安全检查,并承诺在几天内发布详细的事后分析报告。 该事件凸显了在不受限的文件系统访问下部署强大 AI 编程代理的现实安全风险。即使有防护措施,一个简单的环境变量处理错误也可能导致灾难性的数据丢失,影响依赖这些工具提高生产力的开发者。这强调了在 AI 辅助开发环境中建立强大沙盒和审批机制的必要性。 该漏洞在 Codex 以完全访问模式运行且禁用沙盒和自动审查时出现。模型试图覆盖 $HOME 以创建临时目录,结果删除了真实的主目录。OpenAI 称这种情况“极为罕见”,并正在采取措施,如更新开发者消息、引导用户使用更安全的权限模式,以及在 harness 层面增加安全检查。详细的事后分析报告将在未来几天内发布。

@dotey引用推文OpenAI 正面回应了 GPT-5.6 在用户电脑上删文件这事,结论是:GPT-5.6 在执行编程任务时,可能会把用户的整个主目录($HOME)给删了。 出现这种问题的原因是这样的: 用户开启了 Codex 的完全访问模式(Full Access),关掉了沙盒保护,也没开自动审查(Auto Review)。模型在做清理任务时,试图重写 $HOME 环境变量来指定一个临时目录,结果搞混了,把真正的 $HOME 目录删掉了。 Tibo 说 OpenAI 正在采取措施:更新开发者提示信息,引导用户使用更安全的权限模式,在 Codex 的 Harness 加额外的安全检查。他还承诺几天内会发一篇详细的事后分析报告。展开原推文收起原推文

@dotey

OpenAI 正面回应了 GPT-5.6 在用户电脑上删文件这事,结论是:GPT-5.6 在执行编程任务时,可能会把用户的整个主目录($HOME)给删了。 出现这种问题的原因是这样的: 用户开启了 Codex 的完全访问模式(Full Access),关掉了沙盒保护,也没开自动审查(Auto Review)。模型在做清理任务时,试图重写 $HOME 环境变量来指定一个临时目录,结果搞混了,把真正的 $HOME 目录删掉了。 Tibo 说 OpenAI 正在采取措施:更新开发者提示信息,引导用户使用更安全的权限模式,在 Codex 的 Harness 加额外的安全检查。他还承诺几天内会发一篇详细的事后分析报告。

@thsottiaux

On file deletions. We’ve investigated a handful of reports where GPT-5.6 unexpectedly deleted files. What we have found is that this most commonly occurs when: - Full access mode is enabled and codex is run without sandboxing protections, including without auto review being enabled - The model attempts to override the $HOME env var to define a temporary directory. - The model makes an honest mistake and mistakenly deletes $HOME instead. This is of course not how we want the system to behave, even when a user operates the model in full-access mode without the safeguards of our sandbox or without using auto review which checks for these kinds of high risk actions and rejects them. We are taking steps to mitigate this risk including by updating the developer message, guiding more users towards safer permission modes, and adding additional harness safeguards. Even though this happens extremely rarely, we’ll share a detailed post-mortem in the coming days that goes into more details and what we are doing to minimize risks further.

背景
OpenAI Codex 是一个将自然语言转化为代码的 AI 系统,通常通过 CLI 工具使用。它提供不同的审批模式:“完全访问”授予模型在用户系统上不受限制地读取、写入和执行命令的能力。沙盒机制限制文件系统和网络访问以防止意外损害,自动审查则在执行前检查高风险操作。$HOME 环境变量指向用户的主目录,这是一个包含个人文件和配置的关键位置。

7月17日 16:39在 X 打开#AI Safety #OpenAI #GPT-5.6 #Codex #File Deletion

057.0

AI视频创作需要人类专业能力,而非仅靠工具

由 @uge198568 发布、@dotey 转推的一条热门推文提醒,近期 YouTube 上出现的 Vox 风格 AI 生成视频并非简单组合 AI 工具就能实现。推文强调,要获得高质量成果,需要人类在写作、电影制作和剪辑方面的专业能力来有效引导 AI。 这一见解反驳了 AI 能取代人类创造力的炒作,强调 AI 是放大现有技能的工具,而非替代品。这对内容创作者和 AI 行业很重要,因为它设定了现实的期望,并凸显了在 AI 驱动时代领域专业知识的长久价值。 推文详细分解了过程:用户必须构思素材、规划交互和定义动画效果;AI 无法仅凭简单提示生成精良作品。推文指出,AI 写作、影视和剪辑都要求用户具备基础技能来判断和引导输出。类比“鲁迅用豆包也比你用 Claude 强百倍”强调了人的技能是首要因素。

@uge198568@dotey 转推1 个视频这几天油管的这类vox风格的视频我看了一轮,给大家避下坑 1,所谓的某AI+某AI可以做出这样的作品,这话没错,但这里有个巨坑是,这并不是你给一个主题,给一个文案就能一键做出这样效果的。 2,你要去构思素材是什么,他们之间如何配合,动画效果是什么。如果你无法判断这些,提供这些,AI可以完成,但你做了之后你会发现怎么同样的工具,我做出来是一坨屎呢 3,AI写作,AI影视,AI剪辑,他们本质都是一件事: 你会写,你才能判断以及引导AI怎么写的更好 你懂电影,你才能判断以及引导AI怎么做好分镜头,运镜,人物站位,脚本剧情 你会剪辑,你才能判断剪辑审美是什么,流畅感来自于什么,而不是剪辑程序上的功能和按钮 泼个冷水,也说句实话,你要专注于自己的能力,工具是你的杠杆,你才是所有数字前面的那第一位数。 这话的意思大致就是,鲁迅用豆包,一定也比你用Claude强百倍。原推文媒体预览展开原推文收起原推文

@dotey 转推了

@uge198568

这几天油管的这类vox风格的视频我看了一轮,给大家避下坑 1,所谓的某AI+某AI可以做出这样的作品,这话没错,但这里有个巨坑是,这并不是你给一个主题,给一个文案就能一键做出这样效果的。 2,你要去构思素材是什么,他们之间如何配合,动画效果是什么。如果你无法判断这些,提供这些,AI可以完成,但你做了之后你会发现怎么同样的工具,我做出来是一坨屎呢 3,AI写作,AI影视,AI剪辑,他们本质都是一件事: 你会写,你才能判断以及引导AI怎么写的更好 你懂电影,你才能判断以及引导AI怎么做好分镜头,运镜,人物站位,脚本剧情 你会剪辑,你才能判断剪辑审美是什么,流畅感来自于什么,而不是剪辑程序上的功能和按钮 泼个冷水,也说句实话,你要专注于自己的能力,工具是你的杠杆,你才是所有数字前面的那第一位数。 这话的意思大致就是,鲁迅用豆包,一定也比你用Claude强百倍。

@vbjby3

刚才在油管刷到的视频, 用vox风格的图片, 然后用了Gemini Omin做视频, 这效果杠杆的。

背景
Vox 风格视频是一种流行的解说形式,以纸拼贴动画、信息图表和沉稳的叙事风格为特点。它们需要仔细的研究、视觉品牌和动态图形设计。像 Gemini Omni(Google DeepMind 的多模态视频生成模型)这样的 AI 工具可以辅助创作此类视频,但创意方向和质量控制仍取决于人类专业知识。
社区讨论
社区普遍认同这一提醒,赞赏对 AI 局限性的现实视角。一些人指出,虽然 AI 降低了入门门槛,但无法取代熟练创作者的细致理解。转推和互动表明,人们认同工具的好坏取决于使用者的能力这一观点。

7月17日 05:54在 X 打开#AI #content creation #video production #tools #skill

067.0

Kimi K3 对比 Claude Fable 5:3D 建模更便宜但更慢

一项直接对比测试了 Kimi K3 和 Claude Fable 5 在像素风格和原始风格下重建千年隼号的能力。Kimi K3 耗时更长,但成本仅为 Fable 5 的三分之一到一半。原始风格下质量相当,但像素风格下 Kimi K3 表现不及 Fable 5。 该对比突显了前沿 AI 模型在 3D 建模等创意任务中的成本与性能权衡。对于预算敏感或时间要求不高的项目,Kimi K3 可大幅节省开支。它还表明模型性能会因艺术风格而异,这对选择工具的艺术家和开发者很重要。 像素风格测试中,Kimi K3 耗时 1 小时 11 分钟,花费 14.5 美元;Fable 5 耗时 49 分钟,花费 21 美元。原始风格测试中,Kimi K3 耗时 1 小时 17 分钟,花费 19.3 美元;Fable 5 耗时 1 小时 5 分钟,花费 47.2 美元。两者均设为“最大努力”。Kimi K3 在原始风格下细节水平与 Fable 5 相当,但像素风格下不及。

@gmi_cloud@Kimi_Moonshot 转推1 个视频We tested Kimi K3 against Claude Fable 5 on 3D modeling and animation Asked both to recreate the Millennium Falcon from Star Wars in 1) pixel style 2) original style. Both are on Max effort. Kimi K3 took a bit longer than Fable 5 to generate, but came in ~1/3 cheaper on the 1st test, and less than half the cost on the 2nd. Interestingly, Kimi K3 handled the details at the same level as Fable 5 on the original creation, yet it wasn't at Fable's level for the pixel style. Test 1 (Pixel) Kimi K3: 1hr 11min · $14.5 Fable 5: 49min · $21 Test 2 (Original) Kimi K3: 1hr 17min · $19.3 Fable 5: 1hr 5min · $47.2原推文媒体预览展开原推文收起原推文

@Kimi_Moonshot 转推了

@gmi_cloud

We tested Kimi K3 against Claude Fable 5 on 3D modeling and animation Asked both to recreate the Millennium Falcon from Star Wars in 1) pixel style 2) original style. Both are on Max effort. Kimi K3 took a bit longer than Fable 5 to generate, but came in ~1/3 cheaper on the 1st test, and less than half the cost on the 2nd. Interestingly, Kimi K3 handled the details at the same level as Fable 5 on the original creation, yet it wasn't at Fable's level for the pixel style. Test 1 (Pixel) Kimi K3: 1hr 11min · $14.5 Fable 5: 49min · $21 Test 2 (Original) Kimi K3: 1hr 17min · $19.3 Fable 5: 1hr 5min · $47.2

背景
Kimi K3 是月之暗面推出的 2.8 万亿参数模型,拥有 100 万 token 上下文窗口,专为长程编码和知识工作设计。Claude Fable 5 是 Anthropic 的“神话级”模型,面向自主、长时间运行的项目。两者都是前沿大语言模型,可通过 API 应用于 3D 建模等多模态任务。该对比通过重建千年隼号这一具体创意任务,评估生成质量、速度和成本。

7月17日 12:06在 X 打开#AI #3D modeling #benchmark #cost comparison #Kimi K3

077.0

Qwen3-ASR在字幕转录中优于Whisper,时间戳更准且语言支持更好

一位开发者对比了Whisper和Qwen3-ASR在字幕转录中的表现,发现Whisper存在时间戳不准、中英文混排支持差、无说话人识别等问题。Qwen3-ASR配合Qwen3-ForcedAligner模型能提供精准的词级时间戳,0.6B模型即可本地高效运行。还讨论了使用Pyannote和WeSpeaker的开源说话人识别方案,以及火山引擎豆包模型2.0等云端高精度替代方案。 该对比为多语言字幕生成(尤其是中文内容)提供了一个实用且经济的Whisper替代方案。更精准的时间戳和本地运行能力减少了人工校对和云端成本,惠及内容创作者、翻译人员和转录工具开发者。这也展现了开源ASR生态的日益成熟。 Qwen3-ASR的0.6B模型足以实现精准的强制对齐,支持11种语言,可处理最长5分钟的片段。通过Pyannote和WeSpeaker进行说话人识别在人数少时效果良好,但多人同时说话时准确率下降;结合Agent上下文可提升效果。高要求场景下,火山引擎豆包录音识别模型2.0提供快速高质量的云端转录,但需额外付费。开发者还分享了使用Claude Code的UI原型设计流程:Opus 4.8负责设计,Fable 5负责实现。

@dotey引用推文2 张图片最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。https://github.com/QwenLM/Qwen3-ASR 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。原推文媒体预览+1展开原推文收起原推文

@dotey

最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。https://github.com/QwenLM/Qwen3-ASR 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。

@dotey

我在开发 BaoCut 这个 App 的时候,是基于一个 Loop 来的: 1. 在开发新功能之前先设计原型(参考图1),借助的是 baoyu-design skill (https://github.com/jimliu/baoyu-design ),配合 Claude Code App 内置的浏览器实施预览调整,模型 Opus 4.8 就很好了,都不需要 Fable 5. GPT 5.6 Sol 设计能力还是不如 Opus 4.8 2. 原型打磨好了后,只需要在同一会话内,让 Claude Code 基于新的 UI 设计去实现功能即可,这块 Claude 做的很好,Fable 5 效果最好,能将设计稿几乎 1:1 还原,如果修改不多 Opus 4.8 也能胜任。 这些 UI 的打磨我还是更放心让 Fable 和 Opus 而不是 GPT,但其他一些不涉及 UI 部分的 GPT 5.6 Sol 就做的很好。 3. 更新好了后测试没问题,就可以通过发布的 skill 发布新版本。 这里可以放心让 Codex 去做了,尤其是它的 CloudFlare Plugin 很好用,直接帮助发布更新安装包到 CF。 这个 loop 的每一个迭代的起点是自己的想法,让 AI 提供设计方案,和 AI 反复讨论后确定方案,然后 AI 实施,AI 实施完成后人再去验证和当初想要的是否一致,如果不一致再让 AI 调整甚至推翻重来。

背景
自动语音识别(ASR)将语音转为文字。Whisper是OpenAI流行的开源ASR模型,但缺乏内置说话人识别(谁在何时说话)功能,且生成的字幕时间戳可能不准。强制对齐是将文本与音频精确匹配并标注时间戳的技术。Qwen3-ASR是阿里巴巴Qwen团队推出的较新模型,在多语言支持和对齐精度上有所提升。Pyannote和WeSpeaker等说话人识别模型用于区分音频中的不同说话人。

7月17日 06:28在 X 打开#ASR #Whisper #Qwen3-ASR #speaker diarization #Claude Code

087.0

商汤开源信息图神器SenseNova U1 V3,新增AI图像编辑能力

商汤发布了开源信息图工具SenseNova U1的V3版本,首次加入AI驱动的信息图编辑能力。该更新支持高精度调整局部文字和整体风格,并自动适配原图的设计风格与排版。用户可在保留核心信息与结构的同时,更换视觉表达方式,使同一内容适配不同品牌与主题。 此次更新将SenseNova U1从单纯的生成工具升级为可编辑的信息图平台,大幅提升营销人员、教育工作者和内容创作者的生产力。通过自动化风格适配和局部文字编辑,它减少了在不同场景中重复使用信息图所需的手动工作。其开源特性以及计划中的自主迭代能力,可能为AI辅助设计工作流树立新标准。 V3模型基于SenseNova-U1-8B-MoT-Infographic-V3架构,采用Mixture of Transformers(MoT)设计以实现高效多模态处理。模型权重可在Hugging Face和ModelScope下载,GitHub上提供文档。下一步将融入自主迭代能力,模型生成信息图后会主动检查内容与版式,发现问题自主调用编辑能力纠错,并通过多轮迭代持续优化,从“用户反复抽卡”走向“模型自主打磨成品”。

@GitHub_Daily原推文1 张图片两个月前,商汤在 GitHub 上悄然开源了一款信息图神器 SenseNova U1。 该项目支持一键生成各种精美海报、图表、食谱卡片、明信片,甚至是 arXiv 风格的页面。 最近,该开源项目的增强版 V3 正式发布,AI 图像编辑能力更上一层。 本次更新,首次加入了信息图编辑能力。 支持高精度调整局部文字和整体风格,大幅提升图像编辑效率。 经过 AI 修改后的文字内容,会自动适配原图像的设计风格与排版。 用户可以在保留核心信息与结构的同时,更换视觉表达方式,使同一份内容适配不同品牌、主题与传播场景。 - 模型权重下载:https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V3 - GitHub 文档:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_model_CN.md - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V3 不仅如此,下一步模型还将融入自主迭代能力。 在生成信息图后主动检查内容与版式,发现问题后自主调用编辑能力完成纠错,并通过多轮迭代持续优化结果。 信息图创作将从 “用户反复抽卡” 进一步走向 “模型自主打磨成品”,一步到位解决 AI 信息图痛点。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

两个月前,商汤在 GitHub 上悄然开源了一款信息图神器 SenseNova U1。 该项目支持一键生成各种精美海报、图表、食谱卡片、明信片,甚至是 arXiv 风格的页面。 最近,该开源项目的增强版 V3 正式发布,AI 图像编辑能力更上一层。 本次更新,首次加入了信息图编辑能力。 支持高精度调整局部文字和整体风格,大幅提升图像编辑效率。 经过 AI 修改后的文字内容,会自动适配原图像的设计风格与排版。 用户可以在保留核心信息与结构的同时,更换视觉表达方式,使同一份内容适配不同品牌、主题与传播场景。 - 模型权重下载:https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V3 - GitHub 文档:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_model_CN.md - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V3 不仅如此,下一步模型还将融入自主迭代能力。 在生成信息图后主动检查内容与版式,发现问题后自主调用编辑能力完成纠错,并通过多轮迭代持续优化结果。 信息图创作将从 “用户反复抽卡” 进一步走向 “模型自主打磨成品”,一步到位解决 AI 信息图痛点。

背景
SenseNova U1是商汤开源的多模态AI模型,基于NEO-unify架构,无需独立的视觉编码器或VAE即可统一理解和生成。它能根据文本提示生成海报、图表、食谱卡片、arXiv风格页面等多种信息图。Mixture of Transformers(MoT)方法使用专门的专家模块来提高效率和可扩展性。Piktochart和Venngage等信息图生成AI工具正日益流行,用于自动化视觉内容创作。

7月17日 10:00在 X 打开#AI #open-source #infographic #image editing #SenseTime

097.0

GitHub仓库收录500+个AI/ML项目代码资源

ashishpatel26在GitHub上创建了一个仓库,收录了500多个涵盖AI、机器学习、深度学习、计算机视觉和NLP的项目代码。该合集已获得超过35000个星标,提供了结构化的教程、项目和论文复现索引。仓库持续更新并接受社区贡献。 该仓库通过提供集中式的精选列表,解决了学习资源零散的问题。它降低了学习者和从业者寻找实战项目的门槛,涵盖从入门教程到高级研究复现。高星标数和持续更新表明其受到社区广泛认可并保持时效性。 该仓库是一个Markdown索引,链接到外部资源,而非托管项目本身。它包含指向其他精选‘awesome’列表的链接,实际上形成了一个元资源。所有链接均经过测试并报告可用,可通过Pull Request贡献。合集涵盖计算机视觉、NLP和通用机器学习等多个领域。

@GitHub_Daily原推文2 张图片想跟着实战项目学机器学习或深度学习,但 网上找到的教程资源,过于零散东一个西一个。 偶然在 GitHub 发现一份专门收录 AI、机器学习、深度学习项目的合集,已经有 35000+ Star。 涵盖机器学习、深度学习、计算机视觉、NLP 等方向的 500 多个项目和教程,入门代码到论文复现都能找到入口。 GitHub:http://github.com/ashishpatel26/500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code 其中不少项目是链向其他优质合集,等同于顺手收集了一整片相关资源。 目前还在持续更新,适合想系统学 AI 或者在找项目练手的朋友,收藏起来慢慢按需翻查。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

想跟着实战项目学机器学习或深度学习,但 网上找到的教程资源,过于零散东一个西一个。 偶然在 GitHub 发现一份专门收录 AI、机器学习、深度学习项目的合集,已经有 35000+ Star。 涵盖机器学习、深度学习、计算机视觉、NLP 等方向的 500 多个项目和教程,入门代码到论文复现都能找到入口。 GitHub:http://github.com/ashishpatel26/500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code 其中不少项目是链向其他优质合集,等同于顺手收集了一整片相关资源。 目前还在持续更新,适合想系统学 AI 或者在找项目练手的朋友,收藏起来慢慢按需翻查。

背景
AI和机器学习教育常依赖项目实践来培养实际技能。然而,由于资源分散,找到结构良好、代码完整的项目可能很耗时。GitHub上的‘awesome’列表是一种流行的社区驱动方式,用于精选特定主题的高质量资源。该仓库汇总了此类列表和单个项目,为学习者提供了一个全面的起点。

7月17日 13:30在 X 打开#machine learning #deep learning #GitHub #curated resources #AI projects

107.0

SideScreen 将安卓平板变成 Mac 的低延迟第二显示器

SideScreen 是一个新的开源工具,能让安卓平板通过 USB-C 或 WiFi 连接,成为 Mac 真正的扩展显示器。它支持硬件加速视频传输,延迟低于 30 毫秒,并提供 HiDPI 模式和纯无头模式,使平板可作为 Mac 的唯一显示器。此外,平板的触摸屏还能充当 macOS 的触控板。 该工具填补了苹果 Sidecar 仅支持 iPad 的空白,为数百万安卓平板用户提供了一种经济高效的方式来提升工作效率。它将闲置设备变成有用的第二屏幕,减少了电子垃圾,并节省了购买专用显示器的费用。对于开发者和远程工作者而言,低延迟和扩展桌面模式能显著改善多任务工作流程。 SideScreen 利用 H.265 硬件加速,在 USB-C 连接下实现低于 30 毫秒的延迟,甚至适合游戏场景。它提供有线和无线两种连接方式,WiFi 连接只需一次性扫码配对。HiDPI 模式确保在高分辨率平板上显示清晰,无头模式则让 Mac mini 或 Mac Studio 无需传统显示器即可运行。该工具免费且开源,代码托管在 GitHub 上。

@GitHub_Daily原推文1 张图片手里有闲置的安卓平板,想让它作为 Mac 电脑第二块屏幕用,避免吃灰。 利用 SideScreen 工具,能把 Android 平板变成 Mac 的第二显示器。 支持 USB-C 有线连接,也可以在同一 WiFi 下无线连接。 而且不是画面镜像,是真正的扩展屏,窗口能像拖到外接显示器一样直接拖过去。 GitHub:http://github.com/tranvuongquocdat/SideScreen 另外还能硬件加速,延迟能压到 30 毫秒以内,平板触屏还能当触控板操作 macOS。 自带 HiDPI 模式和纯无头模式,Mac 不接自带屏幕也能只靠平板独立显示。 适合手头正好有闲置安卓平板、想给它找个新用途的朋友,可以收藏备用。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

手里有闲置的安卓平板,想让它作为 Mac 电脑第二块屏幕用,避免吃灰。 利用 SideScreen 工具,能把 Android 平板变成 Mac 的第二显示器。 支持 USB-C 有线连接,也可以在同一 WiFi 下无线连接。 而且不是画面镜像,是真正的扩展屏,窗口能像拖到外接显示器一样直接拖过去。 GitHub:http://github.com/tranvuongquocdat/SideScreen 另外还能硬件加速,延迟能压到 30 毫秒以内,平板触屏还能当触控板操作 macOS。 自带 HiDPI 模式和纯无头模式,Mac 不接自带屏幕也能只靠平板独立显示。 适合手头正好有闲置安卓平板、想给它找个新用途的朋友,可以收藏备用。

背景
苹果的 Sidecar 功能允许 iPad 作为 Mac 的第二显示器,但不支持安卓设备。许多用户拥有闲置的安卓平板,可以重新用作显示器。SideScreen 利用 USB-C 或 WiFi 连接传输视频,并通过硬件编码将延迟降至最低。HiDPI(高每英寸点数)模式为高分辨率屏幕缩放界面,而无头模式则指计算机在没有直接连接显示器的情况下运行。

7月17日 11:30在 X 打开#open-source #productivity #macOS #Android #display-tool

117.0

早期原型设计可节省AI开发中的token消耗

开发者trq212分享了一个实用见解:在AI开发过程中,尽早构建模型、模式、数据模型和概念验证的原型,有助于避免在生成不需要的输出上浪费token。该建议在southpkcommons的一次演讲中被提及,并由evantana转发。 这一见解很重要,因为token的使用直接影响AI工作流的成本和效率,尤其是在使用大语言模型时。通过先进行原型设计,开发者可以更快地迭代并更有效地分配资源,从而减少浪费并改善整体项目成果。 该方法强调低成本学习:在投入大量计算资源之前,创建低保真度的原型来验证想法。虽然没有提供具体的工具或指标,但这一概念与应用于AI开发的敏捷方法和精益创业原则相一致。

@trq212引用推文1 个视频building prototypes of mockups, schemas, data models, proof of concepts, etc. is the best way to avoid spending tons of tokens before realizing you don't want the output原推文媒体预览展开原推文收起原推文

@trq212

building prototypes of mockups, schemas, data models, proof of concepts, etc. is the best way to avoid spending tons of tokens before realizing you don't want the output

@evantana

The fastest way to build is to find the cheapest way to learn. Claude Code's @trq212 talked about this when he came by @southpkcommons.

背景
在AI开发中,token是模型处理文本的基本单位,其使用量通常会被计量和计费。原型设计涉及创建系统的简化版本,以便尽早测试概念并收集反馈。这种做法在软件工程中很常见,但现在在AI项目中也被强调,以避免代价高昂的迭代。

7月17日 18:47在 X 打开#prototyping #AI development #efficiency #token optimization

126.0

开源项目用国产百元手柄替代 Codex Micro 控制器

一个名为 AgentController 的开源项目(由 gantrol 创建)让廉价的国产游戏手柄能够模拟 OpenAI Codex Micro 设备。它将手柄操作转换为 Codex 命令,将成本从 230 美元降至约 100 元人民币。该项目利用 Codex 在一天内快速开发完成,并已在 GitHub 上开源。 该项目大幅降低了使用物理控制器操作 AI 编程代理的门槛,让更多用户能够负担得起这项技术,尤其是在 230 美元价格过高的地区。它展示了社区驱动的硬件替代方案对抗昂贵官方设备的潜力,可能激发 AI 交互硬件的进一步创新。 该软件目前仅支持 Windows 64 位系统,且为早期原型,存在已知问题;重启软件或 Codex(ChatGPT)通常能解决问题。它通过将手柄按键映射到 Codex Micro 功能来工作,但具体的按键映射未详细说明。项目托管在 https://github.com/gantrol/AgentController,并欢迎社区贡献。

@gantrols@dotey 转推3 张图片助力国产百元手柄平替Codex Micro,开源Agent controller。只要人民币,不要230美元。甚至无需运费 大致思路是,将手柄操作转成Codex操作。目前仅支持Windows 64位,由于是一天内(让Codex)赶工出来的,会有不少问题,开软件,重启Codex(ChatGPT)会好很多 开源地址:https://github.com/gantrol/AgentController原推文媒体预览+2展开原推文收起原推文

@dotey 转推了

@gantrols

助力国产百元手柄平替Codex Micro,开源Agent controller。只要人民币,不要230美元。甚至无需运费 大致思路是,将手柄操作转成Codex操作。目前仅支持Windows 64位,由于是一天内(让Codex)赶工出来的,会有不少问题,开软件,重启Codex(ChatGPT)会好很多 开源地址:https://github.com/gantrol/AgentController

背景
OpenAI Codex Micro 是一款售价 230 美元的专用键盘,用于与 Codex AI 编程代理交互,为编程任务提供触觉控制。它于 2026 年 7 月作为限量硬件产品推出。开源项目 AgentController 旨在利用廉价且广泛可用的游戏手柄复制这一功能,因为许多手柄具有类似的输入能力。

7月17日 16:27在 X 打开#open-source #agent-controller #codex-micro #gamepad #cost-reduction