7月19日2026 · 星期日

从 36 条抓取中筛选 12 条 · twitter × 3 账号 · 02:36 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. 前学者揭秘:Kimi对AGI的纯粹渴望是推出K3模型的关键8.0
  2. 唐杰论大模型七层逻辑:预训练、智能体与工种替代8.0
  3. 慢雾团队确认针对Claude Code用户的投毒攻击8.0
  4. Kimi K3 在软件工程任务中以 35% 成本匹敌 Claude Fable 58.0
  5. Claude Design 高保真原型可替代传统产品文档8.0
  6. Claude Fable 5 将于7月20日起纳入 Max 和 Team Premium 计划8.0
  7. AI工具捕捉离职同事的编码风格与知识8.0
  8. 桌面版 Codex 与 Claude Code 结合 Computer Use 提升自动化测试效率7.0
  9. Codex 团队成员透露 AI 已编写大部分代码,开发者角色转变7.0
  10. Antra:桌面应用从多个流媒体平台下载带元数据的音乐7.0
  11. GitHub 仓库提供从入门到进阶的结构化 DevOps 实战项目7.0
  12. Tapestry Skills 将收藏内容转化为 Claude Code 可执行的五步行动计划7.0
018.0

前学者揭秘:Kimi对AGI的纯粹渴望是推出K3模型的关键

一位加入Kimi(月之暗面)的前学者分享了该公司成功推出K3模型的内幕。在面试多家AI公司后,他们观察到普遍存在傲慢、浮躁、恐惧和目标不一致的问题,但发现Kimi与众不同,对AGI有着真诚的渴望。这种文化直接促成了K3的发布——一个拥有2800亿参数、100万token上下文窗口的开源模型。 这一内部视角凸显了公司文化和真诚的使命认同如何成为AI进步的决定性因素,而不仅仅是技术资源。它表明通往AGI的竞赛可能既受工程能力影响,也受组织心理影响,而Kimi的做法可能挑战那些更大但更自满的玩家。K3作为开源模型的发布也加剧了前沿AI领域的竞争。 Kimi K3是一个拥有2800亿参数的模型,采用Kimi Delta Attention和Attention Residuals技术,具备原生视觉能力和100万token的上下文窗口。它被定位为全球首个开源3T级模型,在编程、知识工作和推理方面达到前沿性能。作者强调,从创始人对话到执行,团队对AGI的渴望贯穿整个开发过程。

@Xinyu2ML@dotey 转推1 张图片Why can Kimi ship K3? Let me tell my story. Earlier this year, I left academia for industry. I talked to a lot of companies along the way. Here's what I saw: 1⃣Arrogance. They believe the AI war is over, and they won. No hunger for the future, and no hunger for talent. 2⃣Restlessness. Young labs short on foundation, either rushing to catch the frontier or pivoting away from the competition. 3⃣Fear. Strong teams with real experience, but from the second tier, they can't quite bring themselves to aim for #1. 4⃣Misalignment. Everyone is optimizing for their own credit, but nobody really cares whether the company can reach AGI. Kimi was different. Over many conversations with the founders, the same thing came through every time: a raw, genuine hunger for AGI. I joined. The hunger was real. We shipped K3. This is only the beginning.原推文媒体预览展开原推文收起原推文

@dotey 转推了

@Xinyu2ML

Why can Kimi ship K3? Let me tell my story. Earlier this year, I left academia for industry. I talked to a lot of companies along the way. Here's what I saw: 1⃣Arrogance. They believe the AI war is over, and they won. No hunger for the future, and no hunger for talent. 2⃣Restlessness. Young labs short on foundation, either rushing to catch the frontier or pivoting away from the competition. 3⃣Fear. Strong teams with real experience, but from the second tier, they can't quite bring themselves to aim for #1. 4⃣Misalignment. Everyone is optimizing for their own credit, but nobody really cares whether the company can reach AGI. Kimi was different. Over many conversations with the founders, the same thing came through every time: a raw, genuine hunger for AGI. I joined. The hunger was real. We shipped K3. This is only the beginning.

背景
月之暗面(Moonshot AI)是一家中国AI初创公司,以其Kimi聊天机器人和大语言模型而闻名。AGI(通用人工智能)指的是能够像人类一样或超越人类,在广泛任务中理解、学习和应用知识的AI。当前AI行业正激烈竞争开发越来越强大的模型,西方以OpenAI、Google、Anthropic等公司为首,而中国公司如月之暗面、DeepSeek和阿里巴巴也在快速推进。在科技领域,“ship”一词意为向用户发布产品。

7月18日 23:41在 X 打开#AI #industry-insights #Kimi #AGI #startup-culture

028.0

唐杰论大模型七层逻辑:预训练、智能体与工种替代

清华大学教授、智谱AI首席科学家唐杰发表了一篇详细分析,阐述了大模型发展的七层逻辑。他认为预训练仍是基础,但后训练和智能体AI对于实际应用至关重要。他的观点与Andrej Karpathy近期关于从预训练转向多阶段训练和智能体兴起的观察相呼应。 该分析为AI从业者提供了路线图,强调下一个突破将来自能执行现实世界任务的智能体,而非仅仅聊天。它将AI应用开发重新定义为替代人类工种而非创造新应用,这可能重塑创业策略和企业采用。中西方顶级专家观点的一致,标志着行业方向的共识。 唐杰指出七层逻辑:预训练仍能提升智能但导致基准过拟合;智能体是从“学生”到“打工人”的跨越;记忆(短、中、长期)是刚需但未解决;在线学习与自我评估可能是下一个扩展范式;AI的第一性原理是替代工种而非创造新应用;领域大模型是“伪命题”,AGI将吞没它们;多模态与具身智能面临数据和硬件障碍。他预测2026年将取得重大进展。

@frankekn@dotey 转推1 张图片此時再回來看這篇, 依然適用原推文媒体预览展开原推文收起原推文

@dotey 转推了

@frankekn

此時再回來看這篇, 依然適用

@dotey

唐杰 @jietang 是清华大学教授、智谱(GLM 系列模型出自他们家)AI 首席科学家,也是国内最懂大模型的人之一。他刚发了长微博(见评论),谈 2025 年对大模型的感悟。 有意思的是,唐杰和 Andrej Karpathy 的观察有不少共鸣,但也有一些不同的侧重点。两个顶级专家的视角放在一起看,能看出更完整的图景。 内容比较长,但有句话我要特别放在前面高亮一下: > AI 模型应用的第一性原理不应该是创造新的 App,它的本质是 AGI 替代人类工作,因此研发替代不同工种的 AI 是应用的关键 如果你是在做 AI 应用开发,应该反复思考一下这句话:AI 应用的第一性原理不是创造新产品,而是替代人类工作。想清楚这一点,很多事情的优先级就清楚了。 唐杰的核心观点有七层逻辑。 --- 第一层:预训练没死,只是不再是唯一主角 预训练仍然是让模型掌握世界知识和基础推理能力的根基。 更多的数据、更大的参数、更饱和的计算,依然是提升模型智商最高效的办法。这就像还在长身体的孩子,饭量(算力)和营养(数据)必须管够,这是物理规律,没法绕弯。 但光有智商不行,现在的模型有个毛病:容易“偏科”。为了刷榜单(Benchmark),很多模型都在针对性地做题,导致在真实复杂的场景下反而不好用。这好比孩子上完九年义务教育(预训练)后,必须把他扔到真实的职场里去实习,去处理那些书本上没有的烂摊子,这才是真本事。 所以接下来的重点是“中后训练”(Mid and Post training)。中后训练这两个阶段负责「激活」模型的能力,尤其是长尾场景的对齐能力。 什么是长尾场景?就是那些不常见但真实存在的需求。比如帮律师整理某类特殊合同、帮医生分析某种罕见病的影像。这些场景在通用测试集里占比很小,但在真实应用中至关重要。 通用 benchmark 一方面评测了模型效果,但也可能让很多模型过拟合。这和 Karpathy 说的「训练在测试集上是一门新艺术」观点一致。大家都在刷榜,但榜单刷了高分不等于能解决真实问题。 --- 第二层:Agent 是从「学生」到「打工人」的跨越 唐杰用了个形象的比喻: > 如果没有 Agent 能力,大模型就是个“理论博士”。一个人书读得再多,读到了博士后,如果不能动手解决问题,那也只是知识的容器,产生不了生产力。 这个比喻精准。预训练是上课,强化学习是刷题,但这些都还在「学习阶段」。Agent 是让模型真正「干活」的关键,是进入真实世界、产生实际价值的门槛。 不同 Agent 环境的泛化和迁移并不容易。你在一个代码环境里训出来的能力,换到浏览器环境就不一定好使。现在最简单的办法,还是不断堆更多环境的数据,针对不同环境做强化学习。 以前我们做 Agent,是给模型外挂各种工具。现在的趋势是,直接把使用工具的数据写进模型的“DNA”里去训练。 这听起来有点笨,但确实是当下最有效的路径。 Karpathy 也把 Agent 列为今年最重要的变化之一,他以 Claude Code 为例,强调 Agent 要能「住在你电脑里」,调用工具、循环执行、解决复杂问题。 --- 第三层:记忆是刚需,但怎么做还没想清楚 唐杰花了不少篇幅讲记忆。他认为,模型要在真实环境中落地,记忆能力是必须的。 他把人类记忆分成四层: - 短期记忆,对应前额叶 - 中期记忆,对应海马体 - 长期记忆,分布在大脑皮层 - 人类历史记忆,对应维基百科和史书 AI 也要模仿这个机制,大模型对应的可能是: - Context 窗口 → 短期记忆 - RAG 检索 → 中期记忆 - 模型参数 → 长期记忆 一个思路是「压缩记忆」,把重要信息精简后存在 context 里。目前的“超长上下文”只是解决了短期记忆,相当于把它能用的“便签纸”变长了。如果未来 context 窗口足够长,短中长期记忆都有可能实现。 但有个更难的问题:怎么更新模型自身的知识?怎么改参数?这还是个未解难题。 --- 第四层:在线学习和自我评估,可能是下一个 Scaling 范式 这一段是唐杰观点里最前瞻的部分。 现在的模型是“离线”的,训练好就不变了。这有几个问题:模型不能真正自我迭代,重新训练浪费资源,还会丢掉很多交互数据。 理想情况是什么?模型能在线学习,边用边学,越用越聪明。 但要实现这一点,有个前置条件:模型要知道自己对不对。这就是「自我评估」。如果模型能判断自己的输出质量,哪怕是概率性地判断,它就知道了优化目标,就能自我改进。 唐杰认为,构建模型的自我评价机制是个难题,但也可能是下一个 scaling 范式的方向。他用了几个词:continual learning、real time learning、online learning。 这和 Karpathy 提到的 RLVR 有一定呼应。RLVR 之所以有效,正是因为有「可验证的奖励」,模型能知道自己对不对。如果这个机制能泛化到更多场景,在线学习就有可能实现。 --- 第五层:AI 应用的第一性原理是「替代工种」 这是对我启发最大的一句话: > AI 模型应用的第一性原理不应该是创造新的 App,它的本质是 AGI 替代人类工作,因此研发替代不同工种的 AI 是应用的关键 AI 的本质不是创造新的 App,而是替代人类工作。 两条路: 1. 把以前需要人参与的软件 AI 化。 2. 创造对齐人类某个工种的 AI 软件,直接替代人类工作。 Chat 已经部分替代了搜索,同时还融合了情感交互,下一步就是替代客服、替代初级程序员、替代数据分析师。 所以,明年 2026 年的爆发点在于“AI 替代不同工种”。 创业者要思考的不是“我要开发个什么软件给用户用”,而是“我要造一个什么样的 AI 员工,去帮老板把某个岗位的人力成本砍掉”。 换句话说,别老想着做一个「AI+X」的新产品,先想想哪些人类工作可以被替代,再倒推产品形态。 这和 Karpathy 关于「Cursor for X」的观察遥相呼应。Cursor 本质上是「程序员这个工种的 AI 化」,那么各行各业都会出现类似的东西。 --- 第六层:领域大模型是个「伪命题」 这个观点可能会让一些人不舒服,但唐杰说得很直接:领域大模型就是个伪命题。都 AGI 了,哪有什么“领域专用(domain-specific)AGI”? 之所以有领域大模型存在,是因为应用企业不愿意在 AI 模型公司面前认输,希望用领域 know-how 构建护城河,把 AI 驯化为工具。 但 AI 的本质是「海啸」,走到哪里都会把一切卷进去。一定会有领域公司主动走出护城河,被卷进 AGI 的世界。领域的数据、流程、Agent 数据,慢慢都会进入主模型。 当然 AGI 还没实现之前,领域模型会长时间存在。但这个时间窗口有多长?不好说,AI 发展实在太快了。 --- 第七层:多模态和具身智能,前景光明但道路艰难 多模态肯定是未来。但当下的问题是:它对提升 AGI 的智能上限帮助有限。 文本、多模态、多模态生成,可能还是分开发展更高效。当然,探索三者结合需要勇气和钱。 具身智能(机器人)更难。难点和 Agent 一样:通用性。你教会机器人在 A 场景干活,换个场景又不行了。怎么办?采数据、合成数据,都不容易,还贵。 怎么办?采数据,或者合成数据。都不容易,都贵。但反过来,一旦数据规模上去了,通用能力出来了,自然就形成门槛。 还有个问题往往被忽略:机器人本身也是个问题。不稳定、故障频繁,这些硬件问题也在限制具身智能的发展。 唐杰预判 2026 年这些都将取得长足进步。 --- 把唐杰这篇文章串起来,其实是一张相当清晰的路线图: 当下,预训练 scaling 依然有效,但要更重视对齐和长尾能力。 近期,Agent 是关键突破口,让模型从"会说"进化到"会做"。 中期,记忆系统和在线学习是必修课,模型要学会自我评估和迭代。 长期,工种替代是应用的本质,领域护城河会被 AGI 冲垮。 远景,多模态和具身各自发展,等待技术和数据的成熟。 --- 把唐杰和 Karpathy 的观点放在一起看,能看出几个共识: 第一,2025 年的核心变化是训练范式的升级,从「预训练为主」变成「多阶段协同」。 第二,Agent 是里程碑,是模型从学习走向干活的关键跨越。 第三,benchmark 刷分和真实能力之间有鸿沟,这个问题越来越被重视。 第四,AI 应用的本质是替代或增强人类工种,不是为了做 App 而做 App。 不同的侧重点也有意思。Karpathy 更关注「AI 是什么形状的智能」这个哲学问题,唐杰更关注「怎么让模型在真实场景落地」的工程问题。一个偏「理解」,一个偏「实现」。 两个视角都需要。理解清楚了,才知道方向对不对;工程跟上了,才能把想法变成现实。 2026 年,会很精彩。

背景
唐杰是中国顶尖AI研究员,以在智谱AI主导GLM系列模型而闻名。预训练指在大规模文本语料上训练大语言模型的初始阶段,以学习通用知识。后训练包括微调和强化学习,使模型与人类偏好对齐。智能体是能自主使用工具和迭代推理执行任务的AI系统。著名AI科学家Andrej Karpathy近期在3.5小时的LLM讲座中强调了类似趋势。
社区讨论
X(推特)上的原始帖子引发了实质性讨论,许多人认同从预训练转向后训练和智能体是2025年的关键趋势。一些人对在线学习的可行性和AGI吞没领域模型的时间线进行了辩论。与Karpathy观点的比较被广泛赞赏,认为提供了更完整的图景。

7月18日 13:53在 X 打开#AI #LLM #Agent #Pre-training #Post-training

038.0

慢雾团队确认针对Claude Code用户的投毒攻击

慢雾安全团队已验证一起专门针对Anthropic旗下AI编程助手Claude Code用户的投毒攻击。他们公开发出警告,提醒开发者在使用该工具时保持警惕。 该警报突显了AI编程工具成为供应链攻击载体的日益增长的威胁。随着开发者越来越依赖AI代理生成和管理代码,恶意行为者可能利用这些工具向软件项目注入漏洞或后门,从而影响下游用户和系统。 该攻击是一种供应链投毒形式,恶意代码或指令被插入到Claude Code信任的组件(如开源包)中。尽管此次攻击的具体技术细节尚未公开,但类似“Lies-in-the-Loop”的攻击已展示出AI编程代理如何被操纵使用恶意依赖项。该警告来自知名区块链安全公司慢雾,表明攻击可能在加密货币或金融科技领域被观察到。

@evilcos@dotey 转推我们 @SlowMist_Team 已验证,玩 Claude Code 的注意这类投毒攻击。展开原推文收起原推文

@dotey 转推了

@evilcos

我们 @SlowMist_Team 已验证,玩 Claude Code 的注意这类投毒攻击。

背景
Claude Code是Anthropic推出的代理式编程工具,能够理解代码库、编辑文件并运行命令。AI编程工具中的供应链攻击涉及破坏依赖项或注入恶意提示,导致AI生成有漏洞的代码。近期的研究发现了“Lies-in-the-Loop”和“PromptMink”等攻击,威胁行为者操纵AI代理安装恶意包,对软件安全构成风险。

7月18日 06:03在 X 打开#security #Claude Code #AI #supply chain attack #SlowMist

048.0

Kimi K3 在软件工程任务中以 35% 成本匹敌 Claude Fable 5

Together Compute 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5,发现 Kimi K3 以约 35% 的成本实现了相同的性能。此外,在更高的 pass@k 值下,Kimi K3 的表现优于 Fable 5,表明在允许多次尝试时其可靠性更高。 这一成本效率突破使先进的 AI 编码工具更加普及,尤其对初创公司和独立开发者意义重大。这也表明开源模型正在缩小与闭源模型的差距,可能重塑 AI 辅助软件开发的竞争格局。 Kimi K3 是一个 2.8 万亿参数的开源模型,上下文窗口达 100 万 token。在 DeepSWE(一个无污染、长周期的软件工程基准)上,它以约 35% 的成本匹敌 Fable 5 的性能,并在更高 pass@k 时领先。社区测试显示,它只需极少提示即可构建全栈应用和游戏,一个复杂项目的 API 使用成本低至 3.24 美元。

@togethercompute@Kimi_Moonshot 转推1 张图片We analyzed Kimi K3 vs. Claude Fable 5 for software engineering tasks using DeepSWE. Kimi K3 gets you the same performance as Fable 5 at ~35% of the price, and it actually pulls ahead at higher pass@k's. More insights in the thread!原推文媒体预览展开原推文收起原推文

@Kimi_Moonshot 转推了

@togethercompute

We analyzed Kimi K3 vs. Claude Fable 5 for software engineering tasks using DeepSWE. Kimi K3 gets you the same performance as Fable 5 at ~35% of the price, and it actually pulls ahead at higher pass@k's. More insights in the thread!

@ZainHasan6

Deepdive: Kimi K3 vs. Fable 5 on software engineering/DeepSWE tasks. The open frontier isn't 6 months behind anymore! full deep-dive 👇(1/n)🧵

背景
DeepSWE 是一个旨在评估 AI 编码代理在复杂、长周期软件工程任务上表现的基准,减少了数据泄露。Pass@k 衡量生成 k 个解决方案中至少有一个正确的概率;更高的 pass@k 意味着多次尝试时可靠性更高。Claude Fable 5 是 Anthropic 的领先闭源模型,而 Kimi K3 是 Moonshot AI 的开源模型。
社区讨论
社区反应大多积极,用户称赞 K3 的全栈和游戏开发能力。一些人注意到风评从最初的批评转为赞誉,另一些人则强调其成本优势和开源特性是改变游戏规则的关键。

7月18日 15:54在 X 打开#AI #software engineering #cost efficiency #model comparison #DeepSWE

058.0

Claude Design 高保真原型可替代传统产品文档

开发者 @dotey 分享了一套用 Claude Design 生成的高保真交互原型替代传统产品文档的工作流程。这些原型包含模拟数据和交互,能让 AI 以超过九成的还原度实现功能。该流程已在视频剪辑工具 BaoCut 的开发中实践,使用 Claude Opus 4.8 进行设计和代码生成。 该流程通过让设计师快速修改原型而无需触碰代码,加速了迭代,并为 AI 代理提供了比静态文档更丰富的上下文。它弥合了设计与开发之间的鸿沟,可能减少沟通误差和返工。这种方法可能影响团队采用 AI 辅助开发的方式,尤其是对于 UI 密集的应用。 Claude Design 输出 HTML、CSS、React 和 data.js 文件,均为文本格式,可通过 Git 进行版本控制。开发者使用 git diff 让 AI 了解设计变更,再提供截图以更新代码。该流程后来被适配到本地运行,利用 Cursor 的浏览器标记功能和自定义 Skill,避免了从网页端导出的麻烦。开源 Skill 可在 github.com/jimliu/baoyu-design 获取。

@dotey串推 2 条2 段 · 4 张图片高保真原型已经可以代替传统的产品文档了,而且效果更好。Claude Design 出的高保真原型可以交互、有各种模拟的数据,比文档直观多了,这样的设计稿交给 AI,无论你用什么语言实现,基本上能还原 9 成以上。 比如你看我开发 BaoCut 的时候,没有维护设计文档,但是有一份高保真的可交互原型,每次增加/修改功能的时候,先去原型那里修改确认,原型修改起来又快又方便,也不用考虑代码实现。 比如截图是我正在实现的一个为视频添加水印功能(图1): 1. 先提功能需求,让 Opus 4.8 出原型稿(图2) 2. 然后反复打磨原型 (图3) 3. 原型确认清楚了,让 AI 实现最终代码(图4) > 引用 @xDinoDeer: @dotey 完全不用产品文档这一关了吗?原推文媒体预览+3展开原推文收起原推文

@dotey串推 2 条

高保真原型已经可以代替传统的产品文档了,而且效果更好。Claude Design 出的高保真原型可以交互、有各种模拟的数据,比文档直观多了,这样的设计稿交给 AI,无论你用什么语言实现,基本上能还原 9 成以上。 比如你看我开发 BaoCut 的时候,没有维护设计文档,但是有一份高保真的可交互原型,每次增加/修改功能的时候,先去原型那里修改确认,原型修改起来又快又方便,也不用考虑代码实现。 比如截图是我正在实现的一个为视频添加水印功能(图1): 1. 先提功能需求,让 Opus 4.8 出原型稿(图2) 2. 然后反复打磨原型 (图3) 3. 原型确认清楚了,让 AI 实现最终代码(图4) > 引用 @xDinoDeer: @dotey 完全不用产品文档这一关了吗?

@xDinoDeer

@dotey 完全不用产品文档这一关了吗?

这是我以前写的更详细基于 Claude Design 的开发模式 https://x.com/dotey/status/2063674134903603302 > 引用 @dotey: 之所以研究 Claude Design,是因为最近摸索出一套不错的开发模式: > > 1. 先用 Claude Design 去设计 App 的 UI 和 UX,第一版本越简单越好。 > > Claude Design 交付的结果是 HTML + CSS + React + data.js,通过 CSS 一下就可以看清楚设计系统的颜色系统、尺寸规范,通过 React 可以看清楚组件结构,通过 data 可以知道数据结构什么样子。 > > 这几个组合可比 figma 对于 AI 来说友好多了,尤其是 data.jsx,这是一般的设计 App 不会有的,但对开发特别重要的。 > > 还有一个优势就是交付的结果都是文本格式的,可以一起提交到 git 做版本管理,用 git diff 就可以清楚的让 AI 知道设计稿修改了什么。 > > 2. 把 Claude Design 生成设计稿交给 Claude Opus 4.8 去实现一个 MVP,第一个版本只实现 UI 功能,告诉它技术栈(比如 AppKit 而不是 SwiftUI),通过几个小版本的迭代,让它逐步完善。比如第一个版本只是主界面 > > 之所以不用 GPT,是因为 Opus 在 UI 实现上比 GPT 好太多,同样的设计稿,GPT 实现的各种细节问题的,不能很好的遵守设计稿。 > > 之所以不一下子实现太多功能,是因为功能越少 Agent 越容易聚焦,做出来效果越好。所以怎么拆分版本,也是用好 Coding Agent 的一种能力。 > > 非 UI 的功能,用什么模型没有那么大差别,所以我也会用 Codex 配合非 UI 工作。 > > 3. 每次生成一个版本,要让它可以运行,无论是 Agent 还是人都是需要即时反馈的,有了反馈才知道方向对不对,才知道下一步要做什么。 > > 人在测试的时候,能发现各种问题,代码问题就让 Agent 去修改,UI 设计有问题不是马上修改代码,而是要去 Claude Design 去修改设计稿,设计稿修改完了,把设计稿下载回去,替换本地的设计稿文件。 > > 设计稿替换后,让 Agent 去 git diff 分析一下变更,给它个截图,都不用多说它就知道怎么改了。 > > 4. 版本稳定后继续新一轮迭代 > > 当设计的功能做完之后,不一定是要马上去设计新的功能,而是可以重新审查一下实现的代码,重构优化一下。 > > 比如我在第一版实现后,让 Opus 4.8 去做了性能分析,看性能问题在哪,然后告诉我当前用 NSScrollView,内容一多就内存暴涨,建议 NSTableView。 > > 我心想这不应该是一开始就该考虑到的么!不管怎么样亡羊补牢也不算晚。 > > 性能优化完就继续加功能,更新设计稿,让 Agent 参考新设计稿优化功能。 > > --- > > 再回来说研究 Claude Design 的事,因为反复 Claude Design 修改,同步到本地,然后这一步让我后来很烦,因为需要在本地和 Claude Design 网页切换,还要导出下载到本地,解压缩替换。 > > 于是我就想能不能在本地就可以重现 Claude Design 直接集成到本地 Agent,所以我去研究了 Claude Design,然后发现完全可以本地跑起来,只是本地 Agent 在工具调用上有些差异,以及不方便直接在设计稿上标记编辑。 > > 上周正好 Codex 发布了直接调试 iOS 的功能,它带了标记修改的功能,然后我灵机一动,这不正好可以代替 Claude Design 的标记修改功能么。(图2) > > 问题是 GPT 5.5 模型设计能力不够,在 Codex 里面设计效果也不会好。 > > 接着 Cursor 也发布了网页标记功能,这下正好,Cursor 里面可以用 Opus 4.8,做成 Skill 就可以本地运行了,还可以在 Cursor 内置浏览器中,直接标记、评论修改。 > > 好在 Claude Code 的核心逻辑都在浏览器前端,他们在网页上做了个 Harness,这给了我分析的便利,耐心一点就可以分析出所有的 Prompt、内置 Skills、初始组件,再针对 Cursor 的工具做一些兼容就可以跑起来了。(图3) > > 测试对比了一下和在 Claude Design 上跑的效果差不多。(图4) > > 归根结底,还是 Claude Desktop 太拉胯了,Claude Design 本应该集成在 Claude Desktop 的,不然也不需要我这么折腾。 > > 当然不折腾下我也没机会学习 Claude Design 优秀的设计,真的很棒,接下来会系列更新我的学习心得。 > > 推荐去试试最终的 Skill,让你本地就可以跑 Claude Design: > https://github.com/jimliu/baoyu-design

背景
Claude Design 是 Anthropic Labs 推出的产品,允许用户与 Claude 协作创建视觉设计和原型。Claude Opus 4.8 是一款强大的 AI 模型,以出色的 UI 实现和计算机使用能力著称。传统产品文档通常包含静态线框图和文字说明,在向 AI 编码代理传达交互行为时效果较差。
社区讨论
有评论询问是否完全不用产品文档,@dotey 回复了更详细的开发模式文章链接。整体反响积极,大家对该工作流程表现出兴趣。

7月18日 07:57在 X 打开#AI-assisted development #prototyping #Claude Design #workflow #product design

068.0

Claude Fable 5 将于7月20日起纳入 Max 和 Team Premium 计划

从2026年7月20日起,Claude Fable 5 将纳入所有 Max 和 Team Premium 订阅计划,使用限额为50%。Pro 和 Team Standard 用户将继续通过使用额度访问 Fable,并获得一次性100美元额度。这标志着由于额外算力得到保障,该模型从分阶段推出转为永久纳入。 此次更新使高级 AI 功能对高端订阅用户更易获取,可能提升采用率和用户满意度。这反映了 Anthropic 对 GPT-5.6 和 Kimi 3 等模型竞争压力的回应,并表明其基础设施日趋成熟,能够满足不可预测的需求。 Claude Fable 5 是2026年6月9日发布的 Mythos 级模型,经过安全化处理供一般使用。50%限额意味着 Max 和 Team Premium 用户在其计划中获得一半的完整使用上限。Pro 和 Team Standard 用户获得的一次性100美元额度是过渡期的善意表示。

@dotey引用推文靴子落地了:从7月20日起,Claude Fable 5 将包含在所有 Max 和 Team Premium 计划中,限额为50%。 这得感谢 GPT 5.6 和 Kimi 3展开原推文收起原推文

@dotey

靴子落地了:从7月20日起,Claude Fable 5 将包含在所有 Max 和 Team Premium 计划中,限额为50%。 这得感谢 GPT 5.6 和 Kimi 3

@claudeai

Beginning July 20, Claude Fable 5 will be included in all Max and Team Premium plans, at 50% of limits. Pro and Team Standard users will continue to have access to Fable via usage credits, and will receive a one-time $100 credit. Demand for Fable has been challenging to predict, which is why we rolled it out to subscription plans in stages, extending access several times as we secured additional capacity.

背景
Claude Fable 5 是 Anthropic 公司 Claude 系列大语言模型的一部分。它是更强大的 Claude Mythos 5 的安全公开版本,后者因强大的漏洞发现能力而未公开。Anthropic 提供 Pro(20美元/月)、Max(100美元/月)和 Team 等订阅层级。分阶段推出是由于需求难以预测,随着算力增加逐步扩大访问。
社区讨论
社区情绪积极,用户注意到 Fable 5 已成为常驻功能。一些人认为此举得益于 GPT-5.6 和 Kimi 3 的竞争压力。用户对 Anthropic 团队为保障算力所做的努力表示赞赏。

7月18日 02:52在 X 打开#Claude #AI #product update #subscription #Anthropic

078.0

AI工具捕捉离职同事的编码风格与知识

teammate-skill 是一个新的开源AI工具,它吸收离职团队成员的聊天消息、GitHub PR、邮件和文档,生成一个模仿其编码风格、评审标准和决策方式的技能。生成的技能分为两部分:一部分记录工作能力,如代码规范和系统知识;另一部分学习沟通方式和决策风格。该工具支持增量更新和版本回滚。 该工具解决了团队成员离职时常见的知识流失痛点,那些关于代码风格、评审标准和过往踩坑的隐性知识往往随之消失。通过将这些专业知识保存为AI技能,团队可以保持连续性,减少新成员的适应时间,并确保一致的代码质量。它代表了AI在软件开发知识管理中的一种新颖应用。 该工具从Slack、Teams和GitHub收集数据,然后处理成一个五层人格模型。它与Claude Code、OpenClaw及任何兼容AgentSkills的代理一起工作。增量更新允许追加新的聊天记录,并且可以当场纠正错误,每次更新自动留版本以便回滚。

@GitHub_Daily原推文1 张图片团队里有人突然离职,代码风格、评审标准、踩过的坑全都带走了,交接文档往往写不全。 teammate-skill 能把这人的对话消息、GitHub PR、邮件、文档喂进去,生成一个学他说话和做事方式的 AI 技能。 生成的技能分两部分,一部分记工作能力,代码规范、评审重点、系统知识,另一部分学说话方式和决策风格。 GitHub:http://github.com/LeoYeAI/teammate-skill 调用时口吻和判断逻辑都很像本人,代码评审会指出同样的问题,回答问题也是熟悉的语气。 支持增量更新,发现新的聊天记录能追加进去,说错了也能当场纠正,每次更新自动留版本方便回滚。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

团队里有人突然离职,代码风格、评审标准、踩过的坑全都带走了,交接文档往往写不全。 teammate-skill 能把这人的对话消息、GitHub PR、邮件、文档喂进去,生成一个学他说话和做事方式的 AI 技能。 生成的技能分两部分,一部分记工作能力,代码规范、评审重点、系统知识,另一部分学说话方式和决策风格。 GitHub:http://github.com/LeoYeAI/teammate-skill 调用时口吻和判断逻辑都很像本人,代码评审会指出同样的问题,回答问题也是熟悉的语气。 支持增量更新,发现新的聊天记录能追加进去,说错了也能当场纠正,每次更新自动留版本方便回滚。

背景
在软件团队中,隐性知识——如编码约定、评审重点和从过去错误中吸取的教训——通常没有文档记录,并随着成员离开而丢失。传统的交接文档往往不完整。AI技能是可复用的能力,可以添加到AI代理中以执行特定任务。该工具利用大语言模型将一个人的工作产物提炼成一个持久的、可交互的技能。

7月18日 04:00在 X 打开#AI #knowledge management #developer tools #open source #team productivity

087.0

桌面版 Codex 与 Claude Code 结合 Computer Use 提升自动化测试效率

一位开发者推荐使用 Codex 和 Claude Code 的桌面版本,这些版本现在利用 Computer Use 功能在交付前自动测试应用。它们能主动运行测试并自动修复问题,效率远超人工测试。 这一方法解决了测试覆盖不全和人工黑盒测试耗时长的常见痛点。通过将 AI 驱动的自动化测试集成到开发流程中,团队可以加快交付周期并提高软件质量。 特别强调了 Codex 和 Claude Code 的桌面版本能够调用 Computer Use 进行测试。该功能允许 AI 与应用程序的 UI 交互,模拟用户操作并验证功能。这个过程是主动的,在交付前进行,并包括对检测到的问题的自动修复。

@dotey引用推文还有补充一个很重要的点,尽量用 Codex/Claude Code 的Desktop 版本,借助 Compter Use 去自动化测试。 现在桌面版这块做的特别好,交付前都会主动调用 Compter Use 帮你测试一下,有问题会自动修复,这比人工测试效率高多了。 https://x.com/bernadine53742/status/2078411726954037298?s=20展开原推文收起原推文

@dotey

还有补充一个很重要的点,尽量用 Codex/Claude Code 的Desktop 版本,借助 Compter Use 去自动化测试。 现在桌面版这块做的特别好,交付前都会主动调用 Compter Use 帮你测试一下,有问题会自动修复,这比人工测试效率高多了。 https://x.com/bernadine53742/status/2078411726954037298?s=20

@bernadine53742

@dotey 目前是会有一些自动化测试,目前的流程是在开发之前先分析,并且明确测试要点,在开始按流程开发,但是感觉覆盖不全,人工黑盒测试耗费时间太多

背景
Codex 是 OpenAI 的轻量级编码代理,在终端中运行,并有 macOS 桌面应用。Claude Code 是 Anthropic 的代理编码工具,能理解代码库并执行编辑文件和运行命令等任务。Computer Use 是一项功能,使 AI 模型能够控制计算机的 GUI,进行截图并执行点击和按键操作,现在正被应用于自动化测试。
社区讨论
讨论突出了一个常见挑战:现有的自动化测试往往覆盖不全,而人工黑盒测试又太耗时。使用桌面版本结合 Computer Use 的建议被视为提高效率的实用解决方案。

7月18日 14:06在 X 打开#AI-assisted development #automated testing #Claude Code #Codex #Computer Use

097.0

Codex 团队成员透露 AI 已编写大部分代码,开发者角色转变

一位 Codex 团队成员分享称,Codex 现在编写了绝大部分代码,使得一天能发布多个版本。开发者的工作重心从编写代码转向定义功能和验证结果,角色更像产品经理和 QA。 这标志着软件工程的根本性转变,AI 接管了实现细节,人类专注于高层设计和验证。这可能加速开发周期,改变开发者所需的技能,影响招聘和教育。 该开发者指出,他们不再仔细审查代码本身,而是信任 Codex 处理实现。这种转变取决于项目,但趋势是减少直接与代码交互。Codex 是 OpenAI 的轻量级编码代理,在终端运行,利用 GPT-5.6 等模型。

@dotey引用推文如果你惊讶于为什么 Codex 一天能发布几个版本,从这条 Codex 团队成员的推文你大概可以看出,现在绝大部分具体代码已经都是 Codex 在实现了。 我的体验也差不多,日常开发更多变成了产品经理和 QA 的角色:定义功能+验证结果。 至于代码实现,已经不怎么细看了。展开原推文收起原推文

@dotey

如果你惊讶于为什么 Codex 一天能发布几个版本,从这条 Codex 团队成员的推文你大概可以看出,现在绝大部分具体代码已经都是 Codex 在实现了。 我的体验也差不多,日常开发更多变成了产品经理和 QA 的角色:定义功能+验证结果。 至于代码实现,已经不怎么细看了。

@Dimillian

I'm very curious: how close to the code do you still prompt? Do you still ask for specific architecture? Do you still ask for the code to be written in a specific way? For me, it mostly depends on the project, but I can't hide I've been further and further from the actual code.

背景
OpenAI Codex 是一个将自然语言转化为代码的 AI 系统,为 GitHub Copilot 等工具提供支持。它已演变为基于终端的代理,能自主编写、编辑和执行代码。最近的模型如 GPT-5.6 和专用变体(如 gpt-5.3-codex)增强了其编码能力。所描述的转变反映了更广泛的行业趋势,即 AI 辅助开发从自动补全转向全任务自动化。
社区讨论
社区成员普遍认同这一趋势,分享了类似的经验,即更多地依赖 AI 生成代码,专注于更高层次的任务。一些人担心失去对代码的深入理解,而另一些人则认为这是开发者角色不可避免的演变。

7月18日 07:31在 X 打开#AI-assisted development #Codex #developer workflow #software engineering

107.0

Antra:桌面应用从多个流媒体平台下载带元数据的音乐

Antra 是一款新发布的开源桌面应用,用户只需粘贴来自 Spotify、YouTube Music、Apple Music、Amazon Music、Tidal、Qobuz 或 Deezer 的链接,即可自动下载对应的歌曲或专辑。音频文件可以保存为 FLAC、ALAC 等无损格式,或 AAC、MP3 等压缩格式,并包含标题、艺术家、封面和歌词等元数据。文件会自动按艺术家/专辑的文件夹结构整理,可直接用于 Navidrome、Jellyfin 或 Plex 等媒体服务器。 该工具解决了音乐爱好者常见的痛点:将多个流媒体服务上的曲目整合到一个高质量的本地音乐库中。通过自动完成元数据标记和文件夹整理,它节省了大量手动操作,让构建个人音乐收藏并通过自托管服务器进行流媒体播放变得更加容易。它使用户能够拥有自己的音乐文件,减少对流媒体平台的依赖。 Antra 跨平台支持 Windows、macOS 和 Linux。它会获取可用的最高质量源,支持 FLAC 和 ALAC 等无损格式。该应用是开源的,可在 GitHub 上获取,并且不需要复杂的 Python 环境。它能与 Navidrome、Jellyfin 和 Plex 等流行媒体服务器无缝集成。

@GitHub_Daily原推文1 张图片喜欢听的音乐分散在几个平台上,想下载到本地打造音乐库,但又没有音乐封面歌词。 偶然发现 Antra 这个个桌面应用,粘贴一条歌曲或专辑链接,自动拉取保存到本地。 支持保存为 FLAC、ALAC、AAC 或 MP3 文件,包含标题、封面、歌词等内容。 支持 Spotify、YouTube Music、Apple Music 等平台的链接,文件按歌手和专辑自动分好文件夹。 GitHub:http://github.com/anandprtp/Antra 整理好的目录结构能接入 Navidrome、Jellyfin、Plex 这些媒体服务器,不用折腾复杂 Python 环境。 支持 Windows、macOS 和 Linux,适合喜欢自己搭本地音乐库、追求高音质收藏的朋友。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

喜欢听的音乐分散在几个平台上,想下载到本地打造音乐库,但又没有音乐封面歌词。 偶然发现 Antra 这个个桌面应用,粘贴一条歌曲或专辑链接,自动拉取保存到本地。 支持保存为 FLAC、ALAC、AAC 或 MP3 文件,包含标题、封面、歌词等内容。 支持 Spotify、YouTube Music、Apple Music 等平台的链接,文件按歌手和专辑自动分好文件夹。 GitHub:http://github.com/anandprtp/Antra 整理好的目录结构能接入 Navidrome、Jellyfin、Plex 这些媒体服务器,不用折腾复杂 Python 环境。 支持 Windows、macOS 和 Linux,适合喜欢自己搭本地音乐库、追求高音质收藏的朋友。

背景
Spotify 和 Apple Music 等流媒体服务提供了庞大的音乐库,但不允许用户在应用外下载文件以供离线使用。Navidrome、Jellyfin 和 Plex 等媒体服务器让用户可以托管自己的音乐收藏,并将其流式传输到各种设备。封面和歌词等元数据可以提升浏览体验,但手动添加非常繁琐。像 Antra 这样的工具可以自动从流媒体链接下载音乐并添加标签,但用户应注意版权方面的法律问题。
社区讨论
该推文获得了不错的互动,项目也受到好评,用户欣赏其简洁性和跨平台支持。一些人可能会对从流媒体平台下载内容的合法性提出担忧,但整体上对个人使用持积极态度。

7月18日 13:30在 X 打开#music #tool #open-source #local-library #cross-platform

117.0

GitHub 仓库提供从入门到进阶的结构化 DevOps 实战项目

一个名为 DevOps-Projects 的新 GitHub 仓库发布,提供了一套精选的 DevOps 实战项目,并配有完整的部署指南。内容涵盖 AWS 三层架构部署、Kubernetes 集群搭建、Jenkins CI/CD 流水线,以及 Netflix、Zomato 等知名服务的仿版部署。项目按难度分级,从简单的 Linux 基础操作到包含安全扫描和监控告警的完整链路。 许多在线 DevOps 教程偏重理论且零散,缺乏端到端的实战项目,使学习者难以获得真实技能。该仓库通过提供模拟实际工业场景的结构化动手项目,填补了这一空白,帮助学习者建立作品集并转向 DevOps 岗位。它降低了喜欢边做边学且需要清晰学习路径的初学者的入门门槛。 该仓库包含初级、中级和高级项目,从 Linux 基础开始,逐步深入到包含安全扫描和监控的完整 CI/CD 流水线。具体示例包括使用 Kubernetes、SonarQube、Trivy、Jenkins、Prometheus 和 Grafana 部署 Netflix 仿版,以及使用 React.js、Node.js 和负载均衡器部署 AWS 三层架构。项目设计为可逐步跟随,并提供完整的部署指南。

@GitHub_Daily原推文2 张图片想学 DevOps,网上大部分教程只讲理论,比较零散,还缺一套能跟着做的真实项目。 DevOps-Projects 收录了从入门到进阶的实战项目,每个都配完整部署指南。 内容覆盖 AWS 三层架构部署、Kubernetes 集群搭建、Jenkins CI/CD 流水线,还有 Netflix、Zomato 这类知名产品的仿版部署练手。 GitHub:http://github.com/NotHarshhaa/DevOps-Projects 项目按难度分了初级、中级、高级,从简单的 Linux 基础操作,一路做到带安全扫描和监控告警的完整链路。 适合想转 DevOps 又不知道从哪下手、喜欢边做边学的朋友。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

想学 DevOps,网上大部分教程只讲理论,比较零散,还缺一套能跟着做的真实项目。 DevOps-Projects 收录了从入门到进阶的实战项目,每个都配完整部署指南。 内容覆盖 AWS 三层架构部署、Kubernetes 集群搭建、Jenkins CI/CD 流水线,还有 Netflix、Zomato 这类知名产品的仿版部署练手。 GitHub:http://github.com/NotHarshhaa/DevOps-Projects 项目按难度分了初级、中级、高级,从简单的 Linux 基础操作,一路做到带安全扫描和监控告警的完整链路。 适合想转 DevOps 又不知道从哪下手、喜欢边做边学的朋友。

背景
DevOps 是一套结合软件开发(Dev)和 IT 运维(Ops)的实践,旨在缩短开发生命周期并实现持续交付。关键技术包括用于云基础设施的 AWS、用于容器编排的 Kubernetes,以及用于自动化 CI/CD 流水线的 Jenkins。三层架构将应用分为表示层、逻辑层和数据层以实现可扩展性。克隆 Netflix 等流行应用为部署复杂的、基于微服务的应用提供了逼真的练习。

7月18日 07:30在 X 打开#DevOps #GitHub #Kubernetes #CI/CD #AWS

127.0

Tapestry Skills 将收藏内容转化为 Claude Code 可执行的五步行动计划

Tapestry Skills 是一款新的 Claude Code 技能,能自动从 YouTube 链接、文章或 PDF 中提取内容,并生成具体的五步行动计划。它还包含 Session Log 功能,可将对话整理成每周工作日志,以及 Unblock Action 功能,能将模糊任务拆解为具体的下一步。该工具已在 GitHub 上发布,地址为 github.com/michalparkola/tapestry-skills。 该工具解决了收藏学习资源却从不执行的常见生产力缺口,将被动消费转化为主动实践。通过与 Claude Code 集成,它将 AI 辅助的任务规划直接融入开发者工作流,有望提升学习效率和项目执行力。它可能惠及开发者、学习者以及任何受信息过载和拖延困扰的人。 Tapestry Skills 在 Claude Code 中作为单一命令运行,能自动检测内容类型并生成计划。它包含子技能,如用于每周总结的 Session Log 和用于任务分解的 Unblock Action。该工具开源,可通过 Claude Code 个人技能目录手动安装。它在 SkillProof 上获得 8.8/10 的评分,表明社区认可度较高。

@GitHub_Daily原推文1 张图片刷到一篇干货文章或教程视频,随手收藏后,很少真的照着做,学完就跟没学一样。 Tapestry Skills 是给 Claude Code 装的一个学习效率技能,核心只有一个命令。 只需掉一个 YouTube 链接、文章或 PDF,自动识别类型、提取干净内容,直接生成一份能落地的 5 步行动计划。 GitHub:http://github.com/michalparkola/tapestry-skills 还带了几个小技能,比如 Session Log,能把每次对话自动整理进每周工作日志。 Unblock Action 帮着把卡住的模糊任务拆成具体的下一步该干嘛。 适合经常收藏内容却很少执行、想把学到的东西真变成行动的朋友。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

刷到一篇干货文章或教程视频,随手收藏后,很少真的照着做,学完就跟没学一样。 Tapestry Skills 是给 Claude Code 装的一个学习效率技能,核心只有一个命令。 只需掉一个 YouTube 链接、文章或 PDF,自动识别类型、提取干净内容,直接生成一份能落地的 5 步行动计划。 GitHub:http://github.com/michalparkola/tapestry-skills 还带了几个小技能,比如 Session Log,能把每次对话自动整理进每周工作日志。 Unblock Action 帮着把卡住的模糊任务拆成具体的下一步该干嘛。 适合经常收藏内容却很少执行、想把学到的东西真变成行动的朋友。

背景
Claude Code 是 Anthropic 推出的智能编程工具,能理解代码库、编辑文件并运行命令,帮助开发者更快交付。技能是为 Claude Code 添加特定功能的扩展。Tapestry Skills 利用 Claude 的 AI 能力解析多种内容格式,并将其结构化为可执行步骤,旨在解决人们保存资源却从不应用的“收藏者谬误”。

7月18日 02:35在 X 打开#productivity #AI tools #Claude Code #learning #GitHub