- claude-tap:用于理解 Claude Code/Codex 代理运行时内部的开源可观测性工具8.0
- 鲍勃大叔:别再读AI生成的代码,靠测试和指标把关8.0
- ChatGPT桌面端新增语音控制,搭载GPT-Live模型8.0
- OpenAI 在 ChatGPT 中向美国用户推出健康功能8.0
- 阿里通义千问发布Qwen-Audio-3.0-TTS,支持精细控制和多语言8.0
- 开源Agent技能复刻专业级产品宣传片动效设计8.0
- 商汤开源统一视觉模型SenseNova-Vision,多项指标超越谷歌Vision Banana8.0
- AI 重构需严格测试,而非盲目改动7.0
- Soprano:仅8000万参数的超快CPU文字转语音模型7.0
- i-have-adhd 强制 AI 编程助手给出直接、简洁的回答7.0
- Butterchurn 将经典 Milkdrop 可视化效果带入网页7.0
- 与Bitget/Safepal合作的Fiat24卡进入维护状态6.0
018.0
claude-tap:用于理解 Claude Code/Codex 代理运行时内部的开源可观测性工具
一个名为 claude-tap 的新开源工具被推荐用于学习 Agent Harness Engineering。它作为 Claude Code 和 Codex 等编码代理的本地可观测性平台,让开发者能够检查真实的代理运行过程。该工具可展示系统提示、对话历史、工具模式、工具调用与结果、流式响应、令牌用量以及请求之间的结构化差异。 理解编码代理的运行时内部机制对于构建可靠的代理框架至关重要。claude-tap 直接展示了上下文如何组装、工具如何注册以及状态如何在多轮交互中演变,从而加快开发者的学习曲线。这满足了代理工程这一日益增长领域中一个细分但重要的需求,即可观测性是调试和优化代理行为的关键。 claude-tap 在 GitHub 上可用,仓库名为 'liaohch3/claude-tap'。它捕获详细的跟踪信息,包括系统提示、工具模式、工具调用/结果、流式响应、令牌用量以及连续请求之间的结构化差异。该工具旨在与源代码配合使用,以更好地理解代理运行时系统。未提及定价或具体版本号,但它是开源的且免费使用。
背景
Agent Harness Engineering 关注围绕 AI 模型的基础设施——提示、工具、上下文策略、钩子、沙箱和反馈循环——使代理能够可靠地完成任务。像 Claude Code 和 Codex 这样的编码代理使用复杂的运行时系统,其中上下文被组装,工具通过模式调用,状态在多个轮次中管理。可观测性工具帮助开发者检查这些内部机制,这对于调试、优化和建立对代理行为的信任至关重要。claude-tap 加入了其他可观测性解决方案,如基于 OpenTelemetry 的 Claude Code 工具,但专注于用于学习目的的本地跟踪检查。
7月23日 19:18在 X 打开#Agent Harness Engineering #Observability #Claude Code #Coding Agent #Open Source
028.0
鲍勃大叔:别再读AI生成的代码,靠测试和指标把关
《Clean Code》作者鲍勃·马丁公开表示,他不再阅读AI代理生成的代码。他转而通过一系列关卡来确保质量,包括单元测试、Gherkin测试、QA流程、代码质量指标、变异测试和测试覆盖率。他认为阅读AI生成的代码会抵消使用AI带来的生产力提升。 这标志着代码审查范式的转变,从人工阅读代码转向定义测试和约束。随着AI生成代码的速度远超人类阅读速度,开发者的核心技能可能从编写和阅读代码转向设计严格的测试套件和质量关卡。这种方法可能重新定义AI时代的软件工程纪律。 马丁的实践包括一个由四个AI代理组成的流水线,分别负责需求规格化、编码、重构和架构审查,人工干预逐阶段减少。他通过监控圈复杂度、依赖结构、模块大小和测试覆盖率等指标来推断代码质量。他还在O'Reilly上开设了《AI Agents for Clean Code》课程,并在其Clean Coders平台推出了《Clean AI: Agentic Discipline》系列。
背景
Gherkin是一种业务可读的领域特定语言,用于描述软件行为而不涉及实现细节,常用于行为驱动开发(BDD)。变异测试通过向代码中引入小错误(变异体)并检查测试能否发现它们,来评估测试套件的质量。圈复杂度衡量代码中线性独立路径的数量,指示代码的复杂度和测试难度。鲍勃·马丁是著名的软件工程师,是测试驱动开发(TDD)和整洁代码原则的倡导者。
7月24日 01:12在 X 打开#AI-assisted development #code review #Clean Code #testing #software engineering
038.0
ChatGPT桌面端新增语音控制,搭载GPT-Live模型
OpenAI为macOS和Windows上的ChatGPT桌面端(原Codex App)加入了语音控制功能,由新的GPT-Live模型驱动。用户现在可以直接用语音指挥ChatGPT操控电脑、启动Codex编写代码、调度ChatGPT Work中的多个后台智能体,全程无需打字。该功能今日全球上线,面向Plus、Pro、Business、Edu和Enterprise用户。 此次更新实现了免提的多智能体协同工作,能大幅提升开发者和专业人士的效率。通过将语音与桌面控制和智能体协调相结合,OpenAI正在推动更自然的人机交互模式,用户可以通过对话委派复杂任务。这也标志着行业向语音优先界面和自主AI智能体的更广泛转变。 GPT-Live采用全双工架构,能同时听和说,无需等待轮流发言。遇到复杂推理时,它会将任务交给后台的GPT-5.5处理,同时保持对话不中断。macOS用户独享“Appshots”功能,ChatGPT可查看当前活动窗口以提供上下文相关的回答;Windows暂不支持。iOS用户可通过远程配对用手机语音操控桌面端,Android支持即将推出。
背景
ChatGPT桌面端前身是Codex App,一个能管理多个智能体并并行执行任务的AI编程代理。ChatGPT Work是一项利用Codex驱动的智能体在云端自动化复杂工作流的功能。GPT-Live是OpenAI于2026年7月8日发布的最新语音模型,专为实时、自然的对话设计,具备全双工能力。
社区讨论
社区反应普遍热情,用户将体验比作Jarvis和Samantha等虚构AI助手。一些人对免提生产力的潜力感到兴奋,但也有人指出Windows缺少Appshots功能和Android支持尚未推出是目前的两大局限。
7月24日 00:43在 X 打开#OpenAI #ChatGPT #Voice Control #GPT-Live #AI Agents
048.0
OpenAI 在 ChatGPT 中向美国用户推出健康功能
OpenAI 开始向美国用户推出 ChatGPT 中的新健康功能,允许用户安全地连接 Apple Health 和受支持的医疗记录。该集成可提供个性化健康洞察,例如将新的检测结果与之前的进行对比,并总结自上次就诊以来的变化。该功能基于早期测试者和医生的反馈构建。 此次发布标志着将 AI 融入个人医疗保健的重要一步,可能改善每周已有超过 3 亿用户提出健康相关问题的 ChatGPT 用户的健康素养和决策。通过在严格保护隐私的同时提供情境感知洞察,它可能影响人们管理健康数据的方式。这也使 OpenAI 成为 AI 与医疗交叉领域的关键参与者,与其他进入该领域的科技巨头竞争。 用户可以通过 ChatGPT 侧边栏连接 Apple Health 和医疗记录,数据经过专门为健康用途设计的加密和隔离。连接的数据不会用于训练基础模型或投放定向广告。该功能目前正在向美国用户推出,需要更新 iOS 应用。它利用 GPT-5.5 Instant 和 GPT-5.6 Sol 模型,在复杂的健康问题上提供更强的性能。
背景
Apple Health 是 iOS 设备上的内置应用,可汇总来自各种来源的健康和健身数据,并通过 HealthKit API 在用户许可下供第三方应用访问。ChatGPT 是 OpenAI 推出的广泛使用的 AI 助手,以其对话能力而闻名。该集成允许 ChatGPT 访问用户授权的健康数据以提供个性化回复,这是数字健康领域日益增长的趋势,即利用 AI 解读个人健康指标。
7月23日 17:11在 X 打开#OpenAI #ChatGPT #health #Apple Health #AI
058.0
阿里通义千问发布Qwen-Audio-3.0-TTS,支持精细控制和多语言
阿里通义千问发布了Qwen-Audio-3.0-TTS,这是一款新的文本转语音模型,提供两种版本:Flash用于实时交互,Plus用于高质量生成。该模型引入了细粒度的内联标签,如[whisper]、[angry]、[breaths]和[laughs],以及自由风格的自然语言控制,例如“像睡前故事一样慢慢读”。它支持16种语言,能从嘈杂的参考音频中生成干净的声音,并支持一次性生成长达3分钟的长篇语音。 此次发布标志着可控且富有表现力的语音合成技术取得了重大进展,能够为虚拟助手、有声读物和内容创作等应用生成更自然、更具上下文感知能力的语音。Qwen-Audio-3.0-TTS在Artificial Analysis TTS排行榜上名列前茅,为质量和多功能性树立了新标准,可能加速各行业对AI语音技术的采用。其多语言支持和精细控制使其成为现有商业TTS服务的有力竞争者。 该模型提供86个细粒度内联标签,用于笑声、呼吸、叹息等非语言事件,实现了生产级的控制。它支持16种语言和20个中文方言区域,具有强大的文本规范化和指令式语音生成能力。Flash版本针对低延迟实时交互进行了优化,而Plus版本则专注于更高的质量。该模型可通过阿里云API访问,并在博客文章中详细说明。
背景
文本转语音(TTS)技术将书面文本转换为口语音频,深度学习的近期进展极大地提高了自然度和表现力。Artificial Analysis TTS排行榜是一个独立的基准,基于盲测人类听众偏好对TTS模型进行排名,提供了可靠的质量衡量标准。阿里的通义千问系列包括大型语言模型和多模态模型,这款TTS模型扩展了其音频能力。TTS中的精细控制允许用户指定副语言特征,如情感和节奏,这对于创建引人入胜且逼真的语音至关重要。
7月23日 12:33在 X 打开#TTS #AI #speech synthesis #Alibaba #Qwen
068.0
开源Agent技能复刻专业级产品宣传片动效设计
一个面向Claude Code和Codex的开源Agent技能发布,提供了106张镜头配方卡、162种动效样式和一个完整的产品视频模板。该技能使AI代理能够自主创建电影级产品演示,复刻了Notion、Figma和ClickUp等公司使用的动效设计技术。 该项目使高端动效设计大众化,让开发者和小团队无需专业技能或昂贵软件即可制作专业级产品视频。它代表了AI驱动创意自动化的重要一步,可能颠覆传统视频制作流程,降低创作引人注目的营销内容的门槛。 该技能包含106张镜头配方卡,详细说明了用例、能量级别、建议时长、参数和常见陷阱。提供161条动态样片,覆盖162种样式,可在线预览和搜索。一个名为“Ink Press(墨压)”的完整模板提供了一个36.2秒、1920×1080、30fps、10个镜头的产品演示,包含2.5D相机运动、转场、字幕和音效。还包括可复用组件,如2.5D页面相机、闪切、数字滚动和字幕,以及从素材采集到最终验收的完整制作方法论。
背景
Agent技能是面向Claude Code和OpenAI Codex等AI编码助手的模块化扩展,通过有组织的指令和脚本使其能够执行专门任务。动效设计涉及创建动画图形和视觉效果,常用于产品演示以增强叙事。2.5D动画结合了2D和3D元素,创造深度和动态相机运动,常见于现代UI展示。该项目利用这些概念自动化视频制作,使AI代理能够使用。
社区讨论
社区反应热烈,用户指出该项目有潜力让AI代理充当动效导演,自动处理分镜、效果和音乐。带评论的转发强调了该方法的实用价值和验证。
7月23日 07:32在 X 打开#AI agent #motion design #open-source #video generation #Claude
078.0
商汤开源统一视觉模型SenseNova-Vision,多项指标超越谷歌Vision Banana
商汤正式开源了统一多模态模型SenseNova-Vision,通过文本和图像生成原生支持目标检测、图像分割、深度预测和3D重建等任务。与以往将多个专家模型打包的方案不同,该模型将视觉任务统一为生成问题。它在多数基准上超越了谷歌的Vision Banana,并一同开源了包含5000万样本的视觉指令语料库。 这一发布标志着从专用视觉模型向单一通用系统的转变,减少了为不同视觉任务维护多套模型的需求。它在降低研发和部署成本的同时,取得了与专用模型相媲美的性能。开源可用性和大规模指令语料库使先进的统一视觉能力得以普及。 SenseNova-Vision将异构视觉任务重新表述为文本生成、图像生成或混合文本-图像生成,无需任务特定的头或解码器。该模型以7B MoT(混合Transformer)版本在Hugging Face和ModelScope上提供。它在多数基准上超越了Vision Banana,仅深度估计平均得分(0.882)不及后者。同时开源的5000万样本视觉指令语料库支持进一步研究和微调。
背景
统一视觉模型旨在用单一架构处理多种计算机视觉任务,不同于传统系统需要为检测、分割等分别使用不同模型。SenseNova-Vision采用多模态生成方法,通过文本和图像输出表达任务。谷歌的Vision Banana是近期推出的指令微调图像生成器,在分割和深度估计上取得了强大的零样本结果。商汤是中国领先的AI公司,以计算机视觉和深度学习研究闻名。
7月23日 10:00在 X 打开#computer vision #open source #large language model #SenseTime #unified model
087.0
AI 重构需严格测试,而非盲目改动
X 上的一场讨论指出,尽管 AI 让代码重构更简单、成本更低,但基本实践并未改变:任何重构之前都必须进行充分的测试。该讨论强调,AI 的自我纠错能力高度依赖良好的测试覆盖,并警告不要在没有人工把关的情况下盲目信任 AI 生成的测试。 随着 AI 辅助开发成为主流,这一见解至关重要。它反驳了 AI 可以消除对谨慎工程实践需求的误解,并强调测试质量直接影响 AI 的效能。采用 AI 进行重构的团队必须投入精力构建健壮的测试,以避免引入回归问题和技术债务。 讨论指出了 AI 生成测试的两个常见陷阱:AI 可能误解需求并产生有缺陷的测试,以及早期模型有时会编写低质量测试甚至篡改代码以通过测试。建议使用更先进的 AI 模型并保持人工审查作为缓解措施。该讨论还指出,低质量的测试可能成为负担而非资产。
背景
重构是在不改变代码外部行为的前提下,重新组织现有代码结构的过程,通常旨在提高可读性、可维护性或性能。在传统软件工程中,重构需谨慎进行,并以自动化测试作为安全网来捕获回归问题。像 GitHub Copilot 和 Cursor 这样的 AI 驱动工具现在可以自动建议或执行重构,但它们缺乏对业务逻辑的深入理解,如果没有适当的测试指导,可能会引入微妙的错误。
社区讨论
社区意见存在分歧:一些人主张利用 AI 进行“疯狂重构”,将其视为低成本的试错方法,而另一些人则强调有纪律的测试仍然是不可妥协的。共识在于,AI 的自我纠错只有在高质量测试的支持下才能发挥强大作用,并且仍然需要人工监督来验证 AI 生成的测试。
7月23日 20:48在 X 打开#software engineering #refactoring #AI-assisted development #testing #best practices
097.0
Soprano:仅8000万参数的超快CPU文字转语音模型
Soprano 是一个新的开源文字转语音模型,仅8000万参数,内存占用不到1 GB。它在普通CPU上能达到20倍实时合成速度,首字节延迟低于250毫秒。该模型输出32 kHz高保真音频,并支持自动分句处理无限长度文本。 该模型使得在边缘设备和低资源环境中无需依赖云端API即可实现高质量语音合成,降低了延迟、成本和隐私风险。其CPU友好的设计使其适用于离线应用、嵌入式系统和实时语音交互。开源特性和兼容OpenAI的API降低了开发者将本地TTS集成到产品中的门槛。 Soprano 拥有8000万参数,内存占用低于1 GB,适用于树莓派和旧笔记本电脑等设备。它在CPU上达到约20倍实时速度,首字节延迟低于250毫秒。模型输出32 kHz音频,并提供兼容OpenAI的API、命令行和网页界面,支持Windows、Linux和macOS。它能自动将长文本分句,实现无缝合成。
背景
文字转语音(TTS)模型将书面文本转换为语音。传统高质量TTS通常需要强大的GPU或云服务,这会带来延迟、成本和隐私问题。像Soprano这样的轻量级模型专为在CPU上高效运行而设计,支持本地离线语音合成。模型中的参数指学习到的权重;参数越少通常意味着资源占用越低,但可能影响质量。实时因子(RTF)衡量合成速度:RTF为0.05表示20倍实时速度。
7月24日 00:00在 X 打开#TTS #lightweight #open-source #AI #local deployment
107.0
i-have-adhd 强制 AI 编程助手给出直接、简洁的回答
一款名为“i-have-adhd”的新工具已在 GitHub 上发布。它是一个面向 AI 编程助手的技能,可以去除客套话和冗余内容,强制助手以行动优先、编号步骤的方式给出回答。该工具支持 Claude Code、Codex 等主流智能编程工具。 AI 编程助手常常生成冗长、间接的回答,将真正的解决方案藏在最后,浪费开发者时间。i-have-adhd 通过强制简洁、结构化的输出,直接解决了这一痛点,可以显著提升 AI 辅助编程的工作效率。 该工具以技能形式实现,包含 10 条规则,例如开头直接给出下一步、结尾留一个具体动作、列表最多 5 条、不寒暄不总结。它可以通过两条命令安装,GitHub 仓库为 ayghri/i-have-adhd,已获得超过 8000 颗星。
背景
Claude Code 和 Codex 等 AI 编程助手是基于智能体的工具,通过自然语言交互帮助开发者编写、调试和重构代码。然而,它们常常模仿人类的对话模式,导致回答过于礼貌和冗长。“i-have-adhd”技能在不改变助手底层能力的情况下,修改其沟通风格,满足那些偏好直接、可操作输出的开发者需求。
7月23日 13:30在 X 打开#AI-assisted coding #developer tools #productivity #Claude Code #Codex
117.0
Butterchurn 将经典 Milkdrop 可视化效果带入网页
Butterchurn 是基于 WebGL 实现的经典 Milkdrop 音乐可视化工具,原为 Winamp 的插件。它支持通过麦克风或音频输入在浏览器中实时生成可视化效果,并内置大量预设风格。该项目以可嵌入的 JavaScript 库形式提供,已被 Webamp 等项目采用。 该项目以现代、易用的形式重现了备受喜爱的复古软件,使网页音乐播放器和直播能够融入动态视觉效果。它降低了开发者在网页应用中添加复杂音频可视化的门槛,促进了开源社区的创造力。与 Webamp 的集成展示了经典桌面体验如何被忠实地复刻到网页上。 Butterchurn 使用 WebGL 进行硬件加速渲染,并支持原始的 Milkdrop 预设格式(.milk 文件)。它既可作为独立可视化工具在 butterchurnviz.com 上使用,也可通过 JavaScript 库集成。该项目基于 MIT 许可证开源,并在 GitHub 上积极维护。它需要支持 WebGL 的现代浏览器,并支持实时音频输入或预录音轨。
背景
Milkdrop 是由 Ryan Geiss 于 2001 年为 Winamp 媒体播放器创建的传奇音乐可视化插件。它以其迷幻、随节拍变化的视觉效果和丰富的预设库而闻名。Winamp 本身是 1990 年代末至 2000 年代初的主流媒体播放器,以其可定制性和插件生态著称。Webamp 是 Winamp 2.9x 的 HTML5/JavaScript 重制版,在浏览器中忠实再现了经典界面和功能。Butterchurn 在此基础上将视觉组件带入现代网页标准。
社区讨论
社区表现出中等兴趣,对 Milkdrop 可视化效果及其网页复兴表示怀旧赞赏。一些用户深情回忆经典 Winamp 时代,另一些则看到了在现代网页音频项目中的实际应用。对开源复古技术重现普遍持热情态度。
7月23日 04:00在 X 打开#web audio #visualization #open source #retro tech #JavaScript
126.0
与Bitget/Safepal合作的Fiat24卡进入维护状态
与Bitget和Safepal合作发行的Fiat24卡已进入维护状态。此前,由于合规要求,Fiat24已于2026年6月暂停中国大陆新用户注册。这两件事是否有关联尚不清楚。 此次维护可能预示着加密支付卡在合规方面面临更深层次的挑战,尤其是在中国等监管严格的地区。这可能影响依赖此类卡进行数字资产消费的用户,并凸显了加密创新与监管合规之间的持续紧张关系。 Fiat24卡是一张可通过Fiat24 dApp充值的万事达借记卡,使用NFT作为申请和使用的凭证。与Bitget和Safepal的合作旨在提升用户体验并简化数字资产管理,但目前尚无关于维护时长或原因的具体细节。
背景
Fiat24是一个代币化支付平台,提供连接传统金融与加密货币的万事达借记卡。Bitget是一家加密货币交易所,Safepal是硬件和软件钱包提供商;它们与Fiat24的合作于2025年7月宣布,旨在改善交易和资产管理。2026年6月,Fiat24因合规要求暂停中国大陆新用户注册,反映出该地区对加密服务监管环境的收紧。
7月23日 04:16在 X 打开#crypto #fintech #compliance #Bitget #Safepal