- 前学者揭秘:Kimi对AGI的纯粹渴望是推出K3模型的关键8.0
- 唐杰论大模型七层逻辑:预训练、智能体与工种替代8.0
- 慢雾团队确认针对Claude Code用户的投毒攻击8.0
- Kimi K3 在软件工程任务中以 35% 成本匹敌 Claude Fable 58.0
- Claude Design 高保真原型可替代传统产品文档8.0
- Claude Fable 5 将于7月20日起纳入 Max 和 Team Premium 计划8.0
- AI工具捕捉离职同事的编码风格与知识8.0
- 桌面版 Codex 与 Claude Code 结合 Computer Use 提升自动化测试效率7.0
- Codex 团队成员透露 AI 已编写大部分代码,开发者角色转变7.0
- Antra:桌面应用从多个流媒体平台下载带元数据的音乐7.0
- GitHub 仓库提供从入门到进阶的结构化 DevOps 实战项目7.0
- Tapestry Skills 将收藏内容转化为 Claude Code 可执行的五步行动计划7.0
018.0
前学者揭秘:Kimi对AGI的纯粹渴望是推出K3模型的关键
一位加入Kimi(月之暗面)的前学者分享了该公司成功推出K3模型的内幕。在面试多家AI公司后,他们观察到普遍存在傲慢、浮躁、恐惧和目标不一致的问题,但发现Kimi与众不同,对AGI有着真诚的渴望。这种文化直接促成了K3的发布——一个拥有2800亿参数、100万token上下文窗口的开源模型。 这一内部视角凸显了公司文化和真诚的使命认同如何成为AI进步的决定性因素,而不仅仅是技术资源。它表明通往AGI的竞赛可能既受工程能力影响,也受组织心理影响,而Kimi的做法可能挑战那些更大但更自满的玩家。K3作为开源模型的发布也加剧了前沿AI领域的竞争。 Kimi K3是一个拥有2800亿参数的模型,采用Kimi Delta Attention和Attention Residuals技术,具备原生视觉能力和100万token的上下文窗口。它被定位为全球首个开源3T级模型,在编程、知识工作和推理方面达到前沿性能。作者强调,从创始人对话到执行,团队对AGI的渴望贯穿整个开发过程。
背景
月之暗面(Moonshot AI)是一家中国AI初创公司,以其Kimi聊天机器人和大语言模型而闻名。AGI(通用人工智能)指的是能够像人类一样或超越人类,在广泛任务中理解、学习和应用知识的AI。当前AI行业正激烈竞争开发越来越强大的模型,西方以OpenAI、Google、Anthropic等公司为首,而中国公司如月之暗面、DeepSeek和阿里巴巴也在快速推进。在科技领域,“ship”一词意为向用户发布产品。
7月18日 23:41在 X 打开#AI #industry-insights #Kimi #AGI #startup-culture
028.0
唐杰论大模型七层逻辑:预训练、智能体与工种替代
清华大学教授、智谱AI首席科学家唐杰发表了一篇详细分析,阐述了大模型发展的七层逻辑。他认为预训练仍是基础,但后训练和智能体AI对于实际应用至关重要。他的观点与Andrej Karpathy近期关于从预训练转向多阶段训练和智能体兴起的观察相呼应。 该分析为AI从业者提供了路线图,强调下一个突破将来自能执行现实世界任务的智能体,而非仅仅聊天。它将AI应用开发重新定义为替代人类工种而非创造新应用,这可能重塑创业策略和企业采用。中西方顶级专家观点的一致,标志着行业方向的共识。 唐杰指出七层逻辑:预训练仍能提升智能但导致基准过拟合;智能体是从“学生”到“打工人”的跨越;记忆(短、中、长期)是刚需但未解决;在线学习与自我评估可能是下一个扩展范式;AI的第一性原理是替代工种而非创造新应用;领域大模型是“伪命题”,AGI将吞没它们;多模态与具身智能面临数据和硬件障碍。他预测2026年将取得重大进展。
背景
唐杰是中国顶尖AI研究员,以在智谱AI主导GLM系列模型而闻名。预训练指在大规模文本语料上训练大语言模型的初始阶段,以学习通用知识。后训练包括微调和强化学习,使模型与人类偏好对齐。智能体是能自主使用工具和迭代推理执行任务的AI系统。著名AI科学家Andrej Karpathy近期在3.5小时的LLM讲座中强调了类似趋势。
社区讨论
X(推特)上的原始帖子引发了实质性讨论,许多人认同从预训练转向后训练和智能体是2025年的关键趋势。一些人对在线学习的可行性和AGI吞没领域模型的时间线进行了辩论。与Karpathy观点的比较被广泛赞赏,认为提供了更完整的图景。
7月18日 13:53在 X 打开#AI #LLM #Agent #Pre-training #Post-training
038.0
慢雾团队确认针对Claude Code用户的投毒攻击
慢雾安全团队已验证一起专门针对Anthropic旗下AI编程助手Claude Code用户的投毒攻击。他们公开发出警告,提醒开发者在使用该工具时保持警惕。 该警报突显了AI编程工具成为供应链攻击载体的日益增长的威胁。随着开发者越来越依赖AI代理生成和管理代码,恶意行为者可能利用这些工具向软件项目注入漏洞或后门,从而影响下游用户和系统。 该攻击是一种供应链投毒形式,恶意代码或指令被插入到Claude Code信任的组件(如开源包)中。尽管此次攻击的具体技术细节尚未公开,但类似“Lies-in-the-Loop”的攻击已展示出AI编程代理如何被操纵使用恶意依赖项。该警告来自知名区块链安全公司慢雾,表明攻击可能在加密货币或金融科技领域被观察到。
背景
Claude Code是Anthropic推出的代理式编程工具,能够理解代码库、编辑文件并运行命令。AI编程工具中的供应链攻击涉及破坏依赖项或注入恶意提示,导致AI生成有漏洞的代码。近期的研究发现了“Lies-in-the-Loop”和“PromptMink”等攻击,威胁行为者操纵AI代理安装恶意包,对软件安全构成风险。
7月18日 06:03在 X 打开#security #Claude Code #AI #supply chain attack #SlowMist
048.0
Kimi K3 在软件工程任务中以 35% 成本匹敌 Claude Fable 5
Together Compute 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5,发现 Kimi K3 以约 35% 的成本实现了相同的性能。此外,在更高的 pass@k 值下,Kimi K3 的表现优于 Fable 5,表明在允许多次尝试时其可靠性更高。 这一成本效率突破使先进的 AI 编码工具更加普及,尤其对初创公司和独立开发者意义重大。这也表明开源模型正在缩小与闭源模型的差距,可能重塑 AI 辅助软件开发的竞争格局。 Kimi K3 是一个 2.8 万亿参数的开源模型,上下文窗口达 100 万 token。在 DeepSWE(一个无污染、长周期的软件工程基准)上,它以约 35% 的成本匹敌 Fable 5 的性能,并在更高 pass@k 时领先。社区测试显示,它只需极少提示即可构建全栈应用和游戏,一个复杂项目的 API 使用成本低至 3.24 美元。
背景
DeepSWE 是一个旨在评估 AI 编码代理在复杂、长周期软件工程任务上表现的基准,减少了数据泄露。Pass@k 衡量生成 k 个解决方案中至少有一个正确的概率;更高的 pass@k 意味着多次尝试时可靠性更高。Claude Fable 5 是 Anthropic 的领先闭源模型,而 Kimi K3 是 Moonshot AI 的开源模型。
社区讨论
社区反应大多积极,用户称赞 K3 的全栈和游戏开发能力。一些人注意到风评从最初的批评转为赞誉,另一些人则强调其成本优势和开源特性是改变游戏规则的关键。
7月18日 15:54在 X 打开#AI #software engineering #cost efficiency #model comparison #DeepSWE
058.0
Claude Design 高保真原型可替代传统产品文档
开发者 @dotey 分享了一套用 Claude Design 生成的高保真交互原型替代传统产品文档的工作流程。这些原型包含模拟数据和交互,能让 AI 以超过九成的还原度实现功能。该流程已在视频剪辑工具 BaoCut 的开发中实践,使用 Claude Opus 4.8 进行设计和代码生成。 该流程通过让设计师快速修改原型而无需触碰代码,加速了迭代,并为 AI 代理提供了比静态文档更丰富的上下文。它弥合了设计与开发之间的鸿沟,可能减少沟通误差和返工。这种方法可能影响团队采用 AI 辅助开发的方式,尤其是对于 UI 密集的应用。 Claude Design 输出 HTML、CSS、React 和 data.js 文件,均为文本格式,可通过 Git 进行版本控制。开发者使用 git diff 让 AI 了解设计变更,再提供截图以更新代码。该流程后来被适配到本地运行,利用 Cursor 的浏览器标记功能和自定义 Skill,避免了从网页端导出的麻烦。开源 Skill 可在 github.com/jimliu/baoyu-design 获取。
背景
Claude Design 是 Anthropic Labs 推出的产品,允许用户与 Claude 协作创建视觉设计和原型。Claude Opus 4.8 是一款强大的 AI 模型,以出色的 UI 实现和计算机使用能力著称。传统产品文档通常包含静态线框图和文字说明,在向 AI 编码代理传达交互行为时效果较差。
社区讨论
有评论询问是否完全不用产品文档,@dotey 回复了更详细的开发模式文章链接。整体反响积极,大家对该工作流程表现出兴趣。
7月18日 07:57在 X 打开#AI-assisted development #prototyping #Claude Design #workflow #product design
068.0
Claude Fable 5 将于7月20日起纳入 Max 和 Team Premium 计划
从2026年7月20日起,Claude Fable 5 将纳入所有 Max 和 Team Premium 订阅计划,使用限额为50%。Pro 和 Team Standard 用户将继续通过使用额度访问 Fable,并获得一次性100美元额度。这标志着由于额外算力得到保障,该模型从分阶段推出转为永久纳入。 此次更新使高级 AI 功能对高端订阅用户更易获取,可能提升采用率和用户满意度。这反映了 Anthropic 对 GPT-5.6 和 Kimi 3 等模型竞争压力的回应,并表明其基础设施日趋成熟,能够满足不可预测的需求。 Claude Fable 5 是2026年6月9日发布的 Mythos 级模型,经过安全化处理供一般使用。50%限额意味着 Max 和 Team Premium 用户在其计划中获得一半的完整使用上限。Pro 和 Team Standard 用户获得的一次性100美元额度是过渡期的善意表示。
背景
Claude Fable 5 是 Anthropic 公司 Claude 系列大语言模型的一部分。它是更强大的 Claude Mythos 5 的安全公开版本,后者因强大的漏洞发现能力而未公开。Anthropic 提供 Pro(20美元/月)、Max(100美元/月)和 Team 等订阅层级。分阶段推出是由于需求难以预测,随着算力增加逐步扩大访问。
社区讨论
社区情绪积极,用户注意到 Fable 5 已成为常驻功能。一些人认为此举得益于 GPT-5.6 和 Kimi 3 的竞争压力。用户对 Anthropic 团队为保障算力所做的努力表示赞赏。
7月18日 02:52在 X 打开#Claude #AI #product update #subscription #Anthropic
078.0
AI工具捕捉离职同事的编码风格与知识
teammate-skill 是一个新的开源AI工具,它吸收离职团队成员的聊天消息、GitHub PR、邮件和文档,生成一个模仿其编码风格、评审标准和决策方式的技能。生成的技能分为两部分:一部分记录工作能力,如代码规范和系统知识;另一部分学习沟通方式和决策风格。该工具支持增量更新和版本回滚。 该工具解决了团队成员离职时常见的知识流失痛点,那些关于代码风格、评审标准和过往踩坑的隐性知识往往随之消失。通过将这些专业知识保存为AI技能,团队可以保持连续性,减少新成员的适应时间,并确保一致的代码质量。它代表了AI在软件开发知识管理中的一种新颖应用。 该工具从Slack、Teams和GitHub收集数据,然后处理成一个五层人格模型。它与Claude Code、OpenClaw及任何兼容AgentSkills的代理一起工作。增量更新允许追加新的聊天记录,并且可以当场纠正错误,每次更新自动留版本以便回滚。
背景
在软件团队中,隐性知识——如编码约定、评审重点和从过去错误中吸取的教训——通常没有文档记录,并随着成员离开而丢失。传统的交接文档往往不完整。AI技能是可复用的能力,可以添加到AI代理中以执行特定任务。该工具利用大语言模型将一个人的工作产物提炼成一个持久的、可交互的技能。
7月18日 04:00在 X 打开#AI #knowledge management #developer tools #open source #team productivity
087.0
桌面版 Codex 与 Claude Code 结合 Computer Use 提升自动化测试效率
一位开发者推荐使用 Codex 和 Claude Code 的桌面版本,这些版本现在利用 Computer Use 功能在交付前自动测试应用。它们能主动运行测试并自动修复问题,效率远超人工测试。 这一方法解决了测试覆盖不全和人工黑盒测试耗时长的常见痛点。通过将 AI 驱动的自动化测试集成到开发流程中,团队可以加快交付周期并提高软件质量。 特别强调了 Codex 和 Claude Code 的桌面版本能够调用 Computer Use 进行测试。该功能允许 AI 与应用程序的 UI 交互,模拟用户操作并验证功能。这个过程是主动的,在交付前进行,并包括对检测到的问题的自动修复。
背景
Codex 是 OpenAI 的轻量级编码代理,在终端中运行,并有 macOS 桌面应用。Claude Code 是 Anthropic 的代理编码工具,能理解代码库并执行编辑文件和运行命令等任务。Computer Use 是一项功能,使 AI 模型能够控制计算机的 GUI,进行截图并执行点击和按键操作,现在正被应用于自动化测试。
社区讨论
讨论突出了一个常见挑战:现有的自动化测试往往覆盖不全,而人工黑盒测试又太耗时。使用桌面版本结合 Computer Use 的建议被视为提高效率的实用解决方案。
7月18日 14:06在 X 打开#AI-assisted development #automated testing #Claude Code #Codex #Computer Use
097.0
Codex 团队成员透露 AI 已编写大部分代码,开发者角色转变
一位 Codex 团队成员分享称,Codex 现在编写了绝大部分代码,使得一天能发布多个版本。开发者的工作重心从编写代码转向定义功能和验证结果,角色更像产品经理和 QA。 这标志着软件工程的根本性转变,AI 接管了实现细节,人类专注于高层设计和验证。这可能加速开发周期,改变开发者所需的技能,影响招聘和教育。 该开发者指出,他们不再仔细审查代码本身,而是信任 Codex 处理实现。这种转变取决于项目,但趋势是减少直接与代码交互。Codex 是 OpenAI 的轻量级编码代理,在终端运行,利用 GPT-5.6 等模型。
背景
OpenAI Codex 是一个将自然语言转化为代码的 AI 系统,为 GitHub Copilot 等工具提供支持。它已演变为基于终端的代理,能自主编写、编辑和执行代码。最近的模型如 GPT-5.6 和专用变体(如 gpt-5.3-codex)增强了其编码能力。所描述的转变反映了更广泛的行业趋势,即 AI 辅助开发从自动补全转向全任务自动化。
社区讨论
社区成员普遍认同这一趋势,分享了类似的经验,即更多地依赖 AI 生成代码,专注于更高层次的任务。一些人担心失去对代码的深入理解,而另一些人则认为这是开发者角色不可避免的演变。
7月18日 07:31在 X 打开#AI-assisted development #Codex #developer workflow #software engineering
107.0
Antra:桌面应用从多个流媒体平台下载带元数据的音乐
Antra 是一款新发布的开源桌面应用,用户只需粘贴来自 Spotify、YouTube Music、Apple Music、Amazon Music、Tidal、Qobuz 或 Deezer 的链接,即可自动下载对应的歌曲或专辑。音频文件可以保存为 FLAC、ALAC 等无损格式,或 AAC、MP3 等压缩格式,并包含标题、艺术家、封面和歌词等元数据。文件会自动按艺术家/专辑的文件夹结构整理,可直接用于 Navidrome、Jellyfin 或 Plex 等媒体服务器。 该工具解决了音乐爱好者常见的痛点:将多个流媒体服务上的曲目整合到一个高质量的本地音乐库中。通过自动完成元数据标记和文件夹整理,它节省了大量手动操作,让构建个人音乐收藏并通过自托管服务器进行流媒体播放变得更加容易。它使用户能够拥有自己的音乐文件,减少对流媒体平台的依赖。 Antra 跨平台支持 Windows、macOS 和 Linux。它会获取可用的最高质量源,支持 FLAC 和 ALAC 等无损格式。该应用是开源的,可在 GitHub 上获取,并且不需要复杂的 Python 环境。它能与 Navidrome、Jellyfin 和 Plex 等流行媒体服务器无缝集成。
背景
Spotify 和 Apple Music 等流媒体服务提供了庞大的音乐库,但不允许用户在应用外下载文件以供离线使用。Navidrome、Jellyfin 和 Plex 等媒体服务器让用户可以托管自己的音乐收藏,并将其流式传输到各种设备。封面和歌词等元数据可以提升浏览体验,但手动添加非常繁琐。像 Antra 这样的工具可以自动从流媒体链接下载音乐并添加标签,但用户应注意版权方面的法律问题。
社区讨论
该推文获得了不错的互动,项目也受到好评,用户欣赏其简洁性和跨平台支持。一些人可能会对从流媒体平台下载内容的合法性提出担忧,但整体上对个人使用持积极态度。
7月18日 13:30在 X 打开#music #tool #open-source #local-library #cross-platform
117.0
GitHub 仓库提供从入门到进阶的结构化 DevOps 实战项目
一个名为 DevOps-Projects 的新 GitHub 仓库发布,提供了一套精选的 DevOps 实战项目,并配有完整的部署指南。内容涵盖 AWS 三层架构部署、Kubernetes 集群搭建、Jenkins CI/CD 流水线,以及 Netflix、Zomato 等知名服务的仿版部署。项目按难度分级,从简单的 Linux 基础操作到包含安全扫描和监控告警的完整链路。 许多在线 DevOps 教程偏重理论且零散,缺乏端到端的实战项目,使学习者难以获得真实技能。该仓库通过提供模拟实际工业场景的结构化动手项目,填补了这一空白,帮助学习者建立作品集并转向 DevOps 岗位。它降低了喜欢边做边学且需要清晰学习路径的初学者的入门门槛。 该仓库包含初级、中级和高级项目,从 Linux 基础开始,逐步深入到包含安全扫描和监控的完整 CI/CD 流水线。具体示例包括使用 Kubernetes、SonarQube、Trivy、Jenkins、Prometheus 和 Grafana 部署 Netflix 仿版,以及使用 React.js、Node.js 和负载均衡器部署 AWS 三层架构。项目设计为可逐步跟随,并提供完整的部署指南。
背景
DevOps 是一套结合软件开发(Dev)和 IT 运维(Ops)的实践,旨在缩短开发生命周期并实现持续交付。关键技术包括用于云基础设施的 AWS、用于容器编排的 Kubernetes,以及用于自动化 CI/CD 流水线的 Jenkins。三层架构将应用分为表示层、逻辑层和数据层以实现可扩展性。克隆 Netflix 等流行应用为部署复杂的、基于微服务的应用提供了逼真的练习。
7月18日 07:30在 X 打开#DevOps #GitHub #Kubernetes #CI/CD #AWS
127.0
Tapestry Skills 将收藏内容转化为 Claude Code 可执行的五步行动计划
Tapestry Skills 是一款新的 Claude Code 技能,能自动从 YouTube 链接、文章或 PDF 中提取内容,并生成具体的五步行动计划。它还包含 Session Log 功能,可将对话整理成每周工作日志,以及 Unblock Action 功能,能将模糊任务拆解为具体的下一步。该工具已在 GitHub 上发布,地址为 github.com/michalparkola/tapestry-skills。 该工具解决了收藏学习资源却从不执行的常见生产力缺口,将被动消费转化为主动实践。通过与 Claude Code 集成,它将 AI 辅助的任务规划直接融入开发者工作流,有望提升学习效率和项目执行力。它可能惠及开发者、学习者以及任何受信息过载和拖延困扰的人。 Tapestry Skills 在 Claude Code 中作为单一命令运行,能自动检测内容类型并生成计划。它包含子技能,如用于每周总结的 Session Log 和用于任务分解的 Unblock Action。该工具开源,可通过 Claude Code 个人技能目录手动安装。它在 SkillProof 上获得 8.8/10 的评分,表明社区认可度较高。
背景
Claude Code 是 Anthropic 推出的智能编程工具,能理解代码库、编辑文件并运行命令,帮助开发者更快交付。技能是为 Claude Code 添加特定功能的扩展。Tapestry Skills 利用 Claude 的 AI 能力解析多种内容格式,并将其结构化为可执行步骤,旨在解决人们保存资源却从不应用的“收藏者谬误”。
7月18日 02:35在 X 打开#productivity #AI tools #Claude Code #learning #GitHub