7月24日2026 · 星期五

从 21 条抓取中筛选 12 条 · twitter × 5 账号 · 02:34 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. claude-tap:用于理解 Claude Code/Codex 代理运行时内部的开源可观测性工具8.0
  2. 鲍勃大叔:别再读AI生成的代码,靠测试和指标把关8.0
  3. ChatGPT桌面端新增语音控制,搭载GPT-Live模型8.0
  4. OpenAI 在 ChatGPT 中向美国用户推出健康功能8.0
  5. 阿里通义千问发布Qwen-Audio-3.0-TTS,支持精细控制和多语言8.0
  6. 开源Agent技能复刻专业级产品宣传片动效设计8.0
  7. 商汤开源统一视觉模型SenseNova-Vision,多项指标超越谷歌Vision Banana8.0
  8. AI 重构需严格测试,而非盲目改动7.0
  9. Soprano:仅8000万参数的超快CPU文字转语音模型7.0
  10. i-have-adhd 强制 AI 编程助手给出直接、简洁的回答7.0
  11. Butterchurn 将经典 Milkdrop 可视化效果带入网页7.0
  12. 与Bitget/Safepal合作的Fiat24卡进入维护状态6.0
018.0

claude-tap:用于理解 Claude Code/Codex 代理运行时内部的开源可观测性工具

一个名为 claude-tap 的新开源工具被推荐用于学习 Agent Harness Engineering。它作为 Claude Code 和 Codex 等编码代理的本地可观测性平台,让开发者能够检查真实的代理运行过程。该工具可展示系统提示、对话历史、工具模式、工具调用与结果、流式响应、令牌用量以及请求之间的结构化差异。 理解编码代理的运行时内部机制对于构建可靠的代理框架至关重要。claude-tap 直接展示了上下文如何组装、工具如何注册以及状态如何在多轮交互中演变,从而加快开发者的学习曲线。这满足了代理工程这一日益增长领域中一个细分但重要的需求,即可观测性是调试和优化代理行为的关键。 claude-tap 在 GitHub 上可用,仓库名为 'liaohch3/claude-tap'。它捕获详细的跟踪信息,包括系统提示、工具模式、工具调用/结果、流式响应、令牌用量以及连续请求之间的结构化差异。该工具旨在与源代码配合使用,以更好地理解代理运行时系统。未提及定价或具体版本号,但它是开源的且免费使用。

@seekjourney@dotey 转推1 张图片最近朋友推荐一个非常适合学习 Agent Harness Engineering 的工具:claude-tap。 它像是 Claude Code、Codex 等 Coding Agent 的本地可观测性平台,可以看到一次真实 Agent 运行中的: System Prompt 对话历史与上下文 Tool Schema Tool Call / Tool Result 流式响应 Token 用量 相邻请求之间的结构化 Diff 学习 Claude Code / Codex Harness 的核心是运行时系统:上下文如何组装、工具如何注册、状态如何跨轮传递、请求如何持续演化。 我觉得非常适合把源码和真实 Trace 对照着看,理解速度会快很多。 强烈推荐给正在学习 Coding Agent、Agent Runtime 和 Harness Engineering 的朋友。 https://github.com/liaohch3/claude-tap原推文媒体预览展开原推文收起原推文

@dotey 转推了

@seekjourney

最近朋友推荐一个非常适合学习 Agent Harness Engineering 的工具:claude-tap。 它像是 Claude Code、Codex 等 Coding Agent 的本地可观测性平台,可以看到一次真实 Agent 运行中的: System Prompt 对话历史与上下文 Tool Schema Tool Call / Tool Result 流式响应 Token 用量 相邻请求之间的结构化 Diff 学习 Claude Code / Codex Harness 的核心是运行时系统:上下文如何组装、工具如何注册、状态如何跨轮传递、请求如何持续演化。 我觉得非常适合把源码和真实 Trace 对照着看,理解速度会快很多。 强烈推荐给正在学习 Coding Agent、Agent Runtime 和 Harness Engineering 的朋友。 https://github.com/liaohch3/claude-tap

背景
Agent Harness Engineering 关注围绕 AI 模型的基础设施——提示、工具、上下文策略、钩子、沙箱和反馈循环——使代理能够可靠地完成任务。像 Claude Code 和 Codex 这样的编码代理使用复杂的运行时系统,其中上下文被组装,工具通过模式调用,状态在多个轮次中管理。可观测性工具帮助开发者检查这些内部机制,这对于调试、优化和建立对代理行为的信任至关重要。claude-tap 加入了其他可观测性解决方案,如基于 OpenTelemetry 的 Claude Code 工具,但专注于用于学习目的的本地跟踪检查。

7月23日 19:18在 X 打开#Agent Harness Engineering #Observability #Claude Code #Coding Agent #Open Source

028.0

鲍勃大叔:别再读AI生成的代码,靠测试和指标把关

《Clean Code》作者鲍勃·马丁公开表示,他不再阅读AI代理生成的代码。他转而通过一系列关卡来确保质量,包括单元测试、Gherkin测试、QA流程、代码质量指标、变异测试和测试覆盖率。他认为阅读AI生成的代码会抵消使用AI带来的生产力提升。 这标志着代码审查范式的转变,从人工阅读代码转向定义测试和约束。随着AI生成代码的速度远超人类阅读速度,开发者的核心技能可能从编写和阅读代码转向设计严格的测试套件和质量关卡。这种方法可能重新定义AI时代的软件工程纪律。 马丁的实践包括一个由四个AI代理组成的流水线,分别负责需求规格化、编码、重构和架构审查,人工干预逐阶段减少。他通过监控圈复杂度、依赖结构、模块大小和测试覆盖率等指标来推断代码质量。他还在O'Reilly上开设了《AI Agents for Clean Code》课程,并在其Clean Coders平台推出了《Clean AI: Agentic Discipline》系列。

@dotey引用推文前些天 X 上还一堆人讨论要不要看 AI 生成的代码,现在《Clean Code》作者鲍勃大叔都说:“我不看 AI 写的代码” 他的原话是,这是他能利用 AI 生产力的唯一方式。人类读代码太慢了,如果还逐行审查,就丧失了用 AI 的意义。 但不看不等于不管。他的做法是给 AI Agent 设置层层关卡:单元测试、Gherkin 测试(一种用接近自然语言描述软件行为的测试格式)、QA 流程、代码质量指标、变异测试(故意往代码里塞小错误,看测试能不能抓住)、测试覆盖率,等等。 他在今年早些时候还公开了自己的具体实践:一套四个 Agent 组成的流水线,分别负责需求规格化、编码、重构和架构审查,每个阶段都比上一个阶段更形式化,需要的人工干预也更少。他同时还会看测试覆盖率、依赖结构、圈复杂度、模块大小这些指标,从指标推断代码质量,而不是从代码本身。 【注:圈复杂度(Cyclomatic Complexity)衡量代码中独立执行路径的数量,数字越大说明逻辑越复杂,越难维护和测试。】 当 AI 生成代码的速度远超人类阅读代码的速度,代码审查的形态也在跟着改变。以前的核心能力是读代码、写代码,现在可能正在变成写测试、定约束、设指标。鲍勃大叔过去几十年一直在推测试驱动开发(TDD),现在 AI 时代高质量的测试覆盖反而比代码更有价值。 他今年在 O'Reilly 上开了一门课,叫《AI Agents for Clean Code》,也在自己的 Clean Coders 平台推出了新系列《Clean AI: Agentic Discipline》。主旨一样:AI Agent 不是不需要纪律,是需要不同的纪律。展开原推文收起原推文

@dotey

前些天 X 上还一堆人讨论要不要看 AI 生成的代码,现在《Clean Code》作者鲍勃大叔都说:“我不看 AI 写的代码” 他的原话是,这是他能利用 AI 生产力的唯一方式。人类读代码太慢了,如果还逐行审查,就丧失了用 AI 的意义。 但不看不等于不管。他的做法是给 AI Agent 设置层层关卡:单元测试、Gherkin 测试(一种用接近自然语言描述软件行为的测试格式)、QA 流程、代码质量指标、变异测试(故意往代码里塞小错误,看测试能不能抓住)、测试覆盖率,等等。 他在今年早些时候还公开了自己的具体实践:一套四个 Agent 组成的流水线,分别负责需求规格化、编码、重构和架构审查,每个阶段都比上一个阶段更形式化,需要的人工干预也更少。他同时还会看测试覆盖率、依赖结构、圈复杂度、模块大小这些指标,从指标推断代码质量,而不是从代码本身。 【注:圈复杂度(Cyclomatic Complexity)衡量代码中独立执行路径的数量,数字越大说明逻辑越复杂,越难维护和测试。】 当 AI 生成代码的速度远超人类阅读代码的速度,代码审查的形态也在跟着改变。以前的核心能力是读代码、写代码,现在可能正在变成写测试、定约束、设指标。鲍勃大叔过去几十年一直在推测试驱动开发(TDD),现在 AI 时代高质量的测试覆盖反而比代码更有价值。 他今年在 O'Reilly 上开了一门课,叫《AI Agents for Clean Code》,也在自己的 Clean Coders 平台推出了新系列《Clean AI: Agentic Discipline》。主旨一样:AI Agent 不是不需要纪律,是需要不同的纪律。

@unclebobmartin

I’m significantly older than you. I started coding in the late 60s. My current strategy is to not read any of the code written by my agents. That’s the only way I can take advantage of their productivity. What I do instead is to surround the agents with extreme constraints. Unit tests, gherkin tests, QA procedures, quality metrics, mutation testing, test coverage, and a plethora of others. In the end, I have very high confidence in the code they produce because they’ve had to run the gauntlet of all of my constraints and tests.

背景
Gherkin是一种业务可读的领域特定语言,用于描述软件行为而不涉及实现细节,常用于行为驱动开发(BDD)。变异测试通过向代码中引入小错误(变异体)并检查测试能否发现它们,来评估测试套件的质量。圈复杂度衡量代码中线性独立路径的数量,指示代码的复杂度和测试难度。鲍勃·马丁是著名的软件工程师,是测试驱动开发(TDD)和整洁代码原则的倡导者。

7月24日 01:12在 X 打开#AI-assisted development #code review #Clean Code #testing #software engineering

038.0

ChatGPT桌面端新增语音控制,搭载GPT-Live模型

OpenAI为macOS和Windows上的ChatGPT桌面端(原Codex App)加入了语音控制功能,由新的GPT-Live模型驱动。用户现在可以直接用语音指挥ChatGPT操控电脑、启动Codex编写代码、调度ChatGPT Work中的多个后台智能体,全程无需打字。该功能今日全球上线,面向Plus、Pro、Business、Edu和Enterprise用户。 此次更新实现了免提的多智能体协同工作,能大幅提升开发者和专业人士的效率。通过将语音与桌面控制和智能体协调相结合,OpenAI正在推动更自然的人机交互模式,用户可以通过对话委派复杂任务。这也标志着行业向语音优先界面和自主AI智能体的更广泛转变。 GPT-Live采用全双工架构,能同时听和说,无需等待轮流发言。遇到复杂推理时,它会将任务交给后台的GPT-5.5处理,同时保持对话不中断。macOS用户独享“Appshots”功能,ChatGPT可查看当前活动窗口以提供上下文相关的回答;Windows暂不支持。iOS用户可通过远程配对用手机语音操控桌面端,Android支持即将推出。

@dotey引用推文2 个视频ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。原推文媒体预览+1展开原推文收起原推文

@dotey

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

@OpenAI

ChatGPT Voice is now in the desktop app. Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice. It's powered by GPT-Live, so it can speak, listen, and coordinate work in the app at the same time. Rolling out globally today on macOS and Windows to Plus, Pro, Business, Edu, and Enterprise plans.

背景
ChatGPT桌面端前身是Codex App,一个能管理多个智能体并并行执行任务的AI编程代理。ChatGPT Work是一项利用Codex驱动的智能体在云端自动化复杂工作流的功能。GPT-Live是OpenAI于2026年7月8日发布的最新语音模型,专为实时、自然的对话设计,具备全双工能力。
社区讨论
社区反应普遍热情,用户将体验比作Jarvis和Samantha等虚构AI助手。一些人对免提生产力的潜力感到兴奋,但也有人指出Windows缺少Appshots功能和Android支持尚未推出是目前的两大局限。

7月24日 00:43在 X 打开#OpenAI #ChatGPT #Voice Control #GPT-Live #AI Agents

048.0

OpenAI 在 ChatGPT 中向美国用户推出健康功能

OpenAI 开始向美国用户推出 ChatGPT 中的新健康功能,允许用户安全地连接 Apple Health 和受支持的医疗记录。该集成可提供个性化健康洞察,例如将新的检测结果与之前的进行对比,并总结自上次就诊以来的变化。该功能基于早期测试者和医生的反馈构建。 此次发布标志着将 AI 融入个人医疗保健的重要一步,可能改善每周已有超过 3 亿用户提出健康相关问题的 ChatGPT 用户的健康素养和决策。通过在严格保护隐私的同时提供情境感知洞察,它可能影响人们管理健康数据的方式。这也使 OpenAI 成为 AI 与医疗交叉领域的关键参与者,与其他进入该领域的科技巨头竞争。 用户可以通过 ChatGPT 侧边栏连接 Apple Health 和医疗记录,数据经过专门为健康用途设计的加密和隔离。连接的数据不会用于训练基础模型或投放定向广告。该功能目前正在向美国用户推出,需要更新 iOS 应用。它利用 GPT-5.5 Instant 和 GPT-5.6 Sol 模型,在复杂的健康问题上提供更强的性能。

@OpenAI串推 3 条3 段 · 2 张图片Health in ChatGPT is starting to roll out to U.S. users. You can securely connect Apple Health and supported medical records to understand your information in context, track what has changed, and have more informed conversations. https://openai.com/index/health-in-chatgpt/原推文媒体预览+1展开原推文收起原推文

@OpenAI串推 3 条

Health in ChatGPT is starting to roll out to U.S. users. You can securely connect Apple Health and supported medical records to understand your information in context, track what has changed, and have more informed conversations. https://openai.com/index/health-in-chatgpt/

We built this experience based on feedback from early testers and physicians. With your permission, ChatGPT can use relevant context you’ve connected in Health across your conversations — to help you compare a new result with prior tests, summarize changes since your last appointment, or explore how your sleep and activity relate. Connected medical records and Apple Health information are not used to train foundation models or target ads. In the sidebar, Health is your home base for connecting and managing information, browsing records, and revisiting health chats.

More than 300 million people turn to ChatGPT with health-related questions each week—and we’re continuing to improve how our models respond. We work with hundreds of physicians around the world to measure and improve accuracy, safety, communication, context awareness, completeness, and appropriate escalation. GPT‑5.5 Instant brought frontier health intelligence to all free users. GPT‑5.6 Sol builds on that progress with even stronger performance on more complex questions.

Launching Health in ChatGPTopenai.com · 直连原文
背景
Apple Health 是 iOS 设备上的内置应用,可汇总来自各种来源的健康和健身数据,并通过 HealthKit API 在用户许可下供第三方应用访问。ChatGPT 是 OpenAI 推出的广泛使用的 AI 助手,以其对话能力而闻名。该集成允许 ChatGPT 访问用户授权的健康数据以提供个性化回复,这是数字健康领域日益增长的趋势,即利用 AI 解读个人健康指标。

7月23日 17:11在 X 打开#OpenAI #ChatGPT #health #Apple Health #AI

058.0

阿里通义千问发布Qwen-Audio-3.0-TTS,支持精细控制和多语言

阿里通义千问发布了Qwen-Audio-3.0-TTS,这是一款新的文本转语音模型,提供两种版本:Flash用于实时交互,Plus用于高质量生成。该模型引入了细粒度的内联标签,如[whisper]、[angry]、[breaths]和[laughs],以及自由风格的自然语言控制,例如“像睡前故事一样慢慢读”。它支持16种语言,能从嘈杂的参考音频中生成干净的声音,并支持一次性生成长达3分钟的长篇语音。 此次发布标志着可控且富有表现力的语音合成技术取得了重大进展,能够为虚拟助手、有声读物和内容创作等应用生成更自然、更具上下文感知能力的语音。Qwen-Audio-3.0-TTS在Artificial Analysis TTS排行榜上名列前茅,为质量和多功能性树立了新标准,可能加速各行业对AI语音技术的采用。其多语言支持和精细控制使其成为现有商业TTS服务的有力竞争者。 该模型提供86个细粒度内联标签,用于笑声、呼吸、叹息等非语言事件,实现了生产级的控制。它支持16种语言和20个中文方言区域,具有强大的文本规范化和指令式语音生成能力。Flash版本针对低延迟实时交互进行了优化,而Plus版本则专注于更高的质量。该模型可通过阿里云API访问,并在博客文章中详细说明。

@Alibaba_Qwen原推文2 张图片Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quality generation What's new: • Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs] • Free-style natural-language control-“read this slowly, like a bedtime story” • 16 languages • Clean output even from noisy reference audio • One-pass long-form up to 3 min now #1 on the Artificial Analysis TTS Leaderboard. Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/ API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide原推文媒体预览+1展开原推文收起原推文

@Alibaba_Qwen

Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quality generation What's new: • Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs] • Free-style natural-language control-“read this slowly, like a bedtime story” • 16 languages • Clean output even from noisy reference audio • One-pass long-form up to 3 min now #1 on the Artificial Analysis TTS Leaderboard. Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/ API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide

背景
文本转语音(TTS)技术将书面文本转换为口语音频,深度学习的近期进展极大地提高了自然度和表现力。Artificial Analysis TTS排行榜是一个独立的基准,基于盲测人类听众偏好对TTS模型进行排名,提供了可靠的质量衡量标准。阿里的通义千问系列包括大型语言模型和多模态模型,这款TTS模型扩展了其音频能力。TTS中的精细控制允许用户指定副语言特征,如情感和节奏,这对于创建引人入胜且逼真的语音至关重要。

7月23日 12:33在 X 打开#TTS #AI #speech synthesis #Alibaba #Qwen

068.0

开源Agent技能复刻专业级产品宣传片动效设计

一个面向Claude Code和Codex的开源Agent技能发布,提供了106张镜头配方卡、162种动效样式和一个完整的产品视频模板。该技能使AI代理能够自主创建电影级产品演示,复刻了Notion、Figma和ClickUp等公司使用的动效设计技术。 该项目使高端动效设计大众化,让开发者和小团队无需专业技能或昂贵软件即可制作专业级产品视频。它代表了AI驱动创意自动化的重要一步,可能颠覆传统视频制作流程,降低创作引人注目的营销内容的门槛。 该技能包含106张镜头配方卡,详细说明了用例、能量级别、建议时长、参数和常见陷阱。提供161条动态样片,覆盖162种样式,可在线预览和搜索。一个名为“Ink Press(墨压)”的完整模板提供了一个36.2秒、1920×1080、30fps、10个镜头的产品演示,包含2.5D相机运动、转场、字幕和音效。还包括可复用组件,如2.5D页面相机、闪切、数字滚动和字幕,以及从素材采集到最终验收的完整制作方法论。

@Pluvio9yte引用推文1 个视频卧槽,夯爆了啊。 Notion、Figma、ClickUp这些大厂宣传片的动效直接被复刻成 Claude / Codex 能够调用的代码语言了: 106 张镜头配方卡(Shot Recipe Cards):每张卡详细记录用途、能量级别、建议时长、参数、实现要点和常见坑。 161 条动态样片(覆盖 162 种样式):可在线预览、搜索、筛选。 完整成片模板「Ink Press(墨压)」:36.2 秒、1920×1080、30fps、10 个镜头的纸墨琥珀风格产品宣传片,已包含 2.5D 页面相机、转场、字幕和配好的 SFX。 可复用组件:2.5D 页面相机、闪切、数字滚动、字幕、音效等。 完整制作方法论:从素材采集、风格定调、分镜、声音设计、节奏卡点到最终验收的全流程文档。 开源地址 https://github.com/Vincentwei1021/video-shotcraft原推文媒体预览展开原推文收起原推文

@Pluvio9yte

卧槽,夯爆了啊。 Notion、Figma、ClickUp这些大厂宣传片的动效直接被复刻成 Claude / Codex 能够调用的代码语言了: 106 张镜头配方卡(Shot Recipe Cards):每张卡详细记录用途、能量级别、建议时长、参数、实现要点和常见坑。 161 条动态样片(覆盖 162 种样式):可在线预览、搜索、筛选。 完整成片模板「Ink Press(墨压)」:36.2 秒、1920×1080、30fps、10 个镜头的纸墨琥珀风格产品宣传片,已包含 2.5D 页面相机、转场、字幕和配好的 SFX。 可复用组件:2.5D 页面相机、闪切、数字滚动、字幕、音效等。 完整制作方法论:从素材采集、风格定调、分镜、声音设计、节奏卡点到最终验收的全流程文档。 开源地址 https://github.com/Vincentwei1021/video-shotcraft

GitHub - Vincentwei1021/video-shotcraft: A skill for crafting cinematic product videos with shot...github.com · 直连原文

@QingQ77

让 AI agent 自动分镜、动效和配乐,生成电影感产品宣传视频。 一个给 Claude Code / Codex 用的 agent skill,装上之后让 AI 自己当动效导演。项目提供了 106 张镜头卡、162 种动效样式和 161 条动态样片,涵盖了产品宣传片常用的各种拍法。 https://github.com/Vincentwei1021/video-shotcraft

背景
Agent技能是面向Claude Code和OpenAI Codex等AI编码助手的模块化扩展,通过有组织的指令和脚本使其能够执行专门任务。动效设计涉及创建动画图形和视觉效果,常用于产品演示以增强叙事。2.5D动画结合了2D和3D元素,创造深度和动态相机运动,常见于现代UI展示。该项目利用这些概念自动化视频制作,使AI代理能够使用。
社区讨论
社区反应热烈,用户指出该项目有潜力让AI代理充当动效导演,自动处理分镜、效果和音乐。带评论的转发强调了该方法的实用价值和验证。

7月23日 07:32在 X 打开#AI agent #motion design #open-source #video generation #Claude

078.0

商汤开源统一视觉模型SenseNova-Vision,多项指标超越谷歌Vision Banana

商汤正式开源了统一多模态模型SenseNova-Vision,通过文本和图像生成原生支持目标检测、图像分割、深度预测和3D重建等任务。与以往将多个专家模型打包的方案不同,该模型将视觉任务统一为生成问题。它在多数基准上超越了谷歌的Vision Banana,并一同开源了包含5000万样本的视觉指令语料库。 这一发布标志着从专用视觉模型向单一通用系统的转变,减少了为不同视觉任务维护多套模型的需求。它在降低研发和部署成本的同时,取得了与专用模型相媲美的性能。开源可用性和大规模指令语料库使先进的统一视觉能力得以普及。 SenseNova-Vision将异构视觉任务重新表述为文本生成、图像生成或混合文本-图像生成,无需任务特定的头或解码器。该模型以7B MoT(混合Transformer)版本在Hugging Face和ModelScope上提供。它在多数基准上超越了Vision Banana,仅深度估计平均得分(0.882)不及后者。同时开源的5000万样本视觉指令语料库支持进一步研究和微调。

@GitHub_Daily原推文1 张图片前几天,商汤正式开源了理解生成统一视觉大模型:SenseNova-Vision。 行业以往的统一视觉,多是把几个专家模型打包封装好的,本质还是各干各。 这次商汤让视觉成为大模型的原生能力,能完成目标检测、图像分割、深度预测、3D 重建等视觉任务。 在多项权威评测中,比肩各领域的专用专家模型,绝大多数指标超越了谷歌的 Vision Banana。 - 模型权重下载:https://huggingface.co/collections/sensenova/sensenova-vision - GitHub:https://github.com/OpenSenseNova/SenseNova-Vision - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-Vision-7B-MoT 连同模型一起开源的,还有包含 5000 万条高质量样本的视觉指令语料库。 以后不用再为不同视觉任务维护多套模型,单模型就能覆盖高频视觉需求,研发部署成本都降了一截。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

前几天,商汤正式开源了理解生成统一视觉大模型:SenseNova-Vision。 行业以往的统一视觉,多是把几个专家模型打包封装好的,本质还是各干各。 这次商汤让视觉成为大模型的原生能力,能完成目标检测、图像分割、深度预测、3D 重建等视觉任务。 在多项权威评测中,比肩各领域的专用专家模型,绝大多数指标超越了谷歌的 Vision Banana。 - 模型权重下载:https://huggingface.co/collections/sensenova/sensenova-vision - GitHub:https://github.com/OpenSenseNova/SenseNova-Vision - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-Vision-7B-MoT 连同模型一起开源的,还有包含 5000 万条高质量样本的视觉指令语料库。 以后不用再为不同视觉任务维护多套模型,单模型就能覆盖高频视觉需求,研发部署成本都降了一截。

背景
统一视觉模型旨在用单一架构处理多种计算机视觉任务,不同于传统系统需要为检测、分割等分别使用不同模型。SenseNova-Vision采用多模态生成方法,通过文本和图像输出表达任务。谷歌的Vision Banana是近期推出的指令微调图像生成器,在分割和深度估计上取得了强大的零样本结果。商汤是中国领先的AI公司,以计算机视觉和深度学习研究闻名。

7月23日 10:00在 X 打开#computer vision #open source #large language model #SenseTime #unified model

087.0

AI 重构需严格测试,而非盲目改动

X 上的一场讨论指出,尽管 AI 让代码重构更简单、成本更低,但基本实践并未改变:任何重构之前都必须进行充分的测试。该讨论强调,AI 的自我纠错能力高度依赖良好的测试覆盖,并警告不要在没有人工把关的情况下盲目信任 AI 生成的测试。 随着 AI 辅助开发成为主流,这一见解至关重要。它反驳了 AI 可以消除对谨慎工程实践需求的误解,并强调测试质量直接影响 AI 的效能。采用 AI 进行重构的团队必须投入精力构建健壮的测试,以避免引入回归问题和技术债务。 讨论指出了 AI 生成测试的两个常见陷阱:AI 可能误解需求并产生有缺陷的测试,以及早期模型有时会编写低质量测试甚至篡改代码以通过测试。建议使用更先进的 AI 模型并保持人工审查作为缓解措施。该讨论还指出,低质量的测试可能成为负担而非资产。

@dotey串推 2 条2 段 · 1 张图片软件工程应该没有说不要轻易重构,重点是告诉你科学的重构,告诉你重构之前要写好测试。 AI 确实让重构更容易成本更低,但是做事的方式没变,不要盲目重构,先写好测试,哪怕是 AI 写。 AI 真正擅长的是验证出错后的反复自我纠错,所以良好的测试覆盖对 AI 尤其重要。 > 引用 @riverleaf88: AI最擅长的是重构。 > 软件工程曾经告诉你,不要轻易重构。 > 但是我最近的体会是:请疯狂重构。 > 重构是最好的试错方式,也是使用AI编程的过程中代价最小的方式。 > 随时清理技术债,随时重构到更合理的架构和实现方式。 > 这样再复杂的工程AI也能很好地写下去。原推文媒体预览展开原推文收起原推文

@dotey串推 2 条

软件工程应该没有说不要轻易重构,重点是告诉你科学的重构,告诉你重构之前要写好测试。 AI 确实让重构更容易成本更低,但是做事的方式没变,不要盲目重构,先写好测试,哪怕是 AI 写。 AI 真正擅长的是验证出错后的反复自我纠错,所以良好的测试覆盖对 AI 尤其重要。 > 引用 @riverleaf88: AI最擅长的是重构。 > 软件工程曾经告诉你,不要轻易重构。 > 但是我最近的体会是:请疯狂重构。 > 重构是最好的试错方式,也是使用AI编程的过程中代价最小的方式。 > 随时清理技术债,随时重构到更合理的架构和实现方式。 > 这样再复杂的工程AI也能很好地写下去。

@riverleaf88

AI最擅长的是重构。 软件工程曾经告诉你,不要轻易重构。 但是我最近的体会是:请疯狂重构。 重构是最好的试错方式,也是使用AI编程的过程中代价最小的方式。 随时清理技术债,随时重构到更合理的架构和实现方式。 这样再复杂的工程AI也能很好地写下去。

骂 AI 测试也能理解,如果测试质量不好反而是负资产。 https://x.com/bigbigmusic/status/2080395790082863615?s=20 这里通常两个问题: 1. AI 没有理解清楚需求(上下文),按照错误的理解写出来的测试本身是有问题的 2. AI 写不出高质量的测试,这主要是在早期模型能力不够经常发生的,甚至有偷偷篡改代码以通过测试的行为 第一个问题需要人把关,第二个问题建议用好一点模型。 > 引用 @bigbigmusic: @dotey 時間線還一些人罵AI寫測試呢

背景
重构是在不改变代码外部行为的前提下,重新组织现有代码结构的过程,通常旨在提高可读性、可维护性或性能。在传统软件工程中,重构需谨慎进行,并以自动化测试作为安全网来捕获回归问题。像 GitHub Copilot 和 Cursor 这样的 AI 驱动工具现在可以自动建议或执行重构,但它们缺乏对业务逻辑的深入理解,如果没有适当的测试指导,可能会引入微妙的错误。
社区讨论
社区意见存在分歧:一些人主张利用 AI 进行“疯狂重构”,将其视为低成本的试错方法,而另一些人则强调有纪律的测试仍然是不可妥协的。共识在于,AI 的自我纠错只有在高质量测试的支持下才能发挥强大作用,并且仍然需要人工监督来验证 AI 生成的测试。

7月23日 20:48在 X 打开#software engineering #refactoring #AI-assisted development #testing #best practices

097.0

Soprano:仅8000万参数的超快CPU文字转语音模型

Soprano 是一个新的开源文字转语音模型,仅8000万参数,内存占用不到1 GB。它在普通CPU上能达到20倍实时合成速度,首字节延迟低于250毫秒。该模型输出32 kHz高保真音频,并支持自动分句处理无限长度文本。 该模型使得在边缘设备和低资源环境中无需依赖云端API即可实现高质量语音合成,降低了延迟、成本和隐私风险。其CPU友好的设计使其适用于离线应用、嵌入式系统和实时语音交互。开源特性和兼容OpenAI的API降低了开发者将本地TTS集成到产品中的门槛。 Soprano 拥有8000万参数,内存占用低于1 GB,适用于树莓派和旧笔记本电脑等设备。它在CPU上达到约20倍实时速度,首字节延迟低于250毫秒。模型输出32 kHz音频,并提供兼容OpenAI的API、命令行和网页界面,支持Windows、Linux和macOS。它能自动将长文本分句,实现无缝合成。

@GitHub_Daily原推文1 张图片想给应用加个文字转语音功能,调云端接口要联网、还要按次数计费,本地跑配置低输出慢。 偶然发现 Soprano,一个超逼真的轻量文字转语音模型,只有 80M 参数,占用不到 1GB 内存。 在普通 CPU 上合成速度能到实时的 20 倍,开口延迟压到 250 毫秒以内。 GitHub:http://github.com/ekwek1/soprano 长文本会自动分句一段接一段合成,长度没有限制,输出是 32kHz 的清晰音质。 对外提供兼容 OpenAI 的接口,也支持命令行和网页界面,Windows、Linux、Mac 都能用。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

想给应用加个文字转语音功能,调云端接口要联网、还要按次数计费,本地跑配置低输出慢。 偶然发现 Soprano,一个超逼真的轻量文字转语音模型,只有 80M 参数,占用不到 1GB 内存。 在普通 CPU 上合成速度能到实时的 20 倍,开口延迟压到 250 毫秒以内。 GitHub:http://github.com/ekwek1/soprano 长文本会自动分句一段接一段合成,长度没有限制,输出是 32kHz 的清晰音质。 对外提供兼容 OpenAI 的接口,也支持命令行和网页界面,Windows、Linux、Mac 都能用。

背景
文字转语音(TTS)模型将书面文本转换为语音。传统高质量TTS通常需要强大的GPU或云服务,这会带来延迟、成本和隐私问题。像Soprano这样的轻量级模型专为在CPU上高效运行而设计,支持本地离线语音合成。模型中的参数指学习到的权重;参数越少通常意味着资源占用越低,但可能影响质量。实时因子(RTF)衡量合成速度:RTF为0.05表示20倍实时速度。

7月24日 00:00在 X 打开#TTS #lightweight #open-source #AI #local deployment

107.0

i-have-adhd 强制 AI 编程助手给出直接、简洁的回答

一款名为“i-have-adhd”的新工具已在 GitHub 上发布。它是一个面向 AI 编程助手的技能,可以去除客套话和冗余内容,强制助手以行动优先、编号步骤的方式给出回答。该工具支持 Claude Code、Codex 等主流智能编程工具。 AI 编程助手常常生成冗长、间接的回答,将真正的解决方案藏在最后,浪费开发者时间。i-have-adhd 通过强制简洁、结构化的输出,直接解决了这一痛点,可以显著提升 AI 辅助编程的工作效率。 该工具以技能形式实现,包含 10 条规则,例如开头直接给出下一步、结尾留一个具体动作、列表最多 5 条、不寒暄不总结。它可以通过两条命令安装,GitHub 仓库为 ayghri/i-have-adhd,已获得超过 8000 颗星。

@GitHub_Daily原推文1 张图片让 AI 帮忙查个 bug,它先来一句好问题,铺垫一大段,真正要改的那行藏在最后。 i-have-adhd,一个 AI 编程辅助技能,逼 AI 把答案摆到最前面,别废话那么多。 安装后,Agent 回答会变成动作先行、多步骤挨个编号,客套和复述的话一律砍掉。 GitHub:http://github.com/ayghri/i-have-adhd 一共 10 条规则,比如开头直接给下一步、结尾留一个具体动作、列表最多 5 条、不寒暄不总结。 支持 Claude Code、Codex 等主流 Agent 编程工具,两条命令装好。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

让 AI 帮忙查个 bug,它先来一句好问题,铺垫一大段,真正要改的那行藏在最后。 i-have-adhd,一个 AI 编程辅助技能,逼 AI 把答案摆到最前面,别废话那么多。 安装后,Agent 回答会变成动作先行、多步骤挨个编号,客套和复述的话一律砍掉。 GitHub:http://github.com/ayghri/i-have-adhd 一共 10 条规则,比如开头直接给下一步、结尾留一个具体动作、列表最多 5 条、不寒暄不总结。 支持 Claude Code、Codex 等主流 Agent 编程工具,两条命令装好。

背景
Claude Code 和 Codex 等 AI 编程助手是基于智能体的工具,通过自然语言交互帮助开发者编写、调试和重构代码。然而,它们常常模仿人类的对话模式,导致回答过于礼貌和冗长。“i-have-adhd”技能在不改变助手底层能力的情况下,修改其沟通风格,满足那些偏好直接、可操作输出的开发者需求。

7月23日 13:30在 X 打开#AI-assisted coding #developer tools #productivity #Claude Code #Codex

117.0

Butterchurn 将经典 Milkdrop 可视化效果带入网页

Butterchurn 是基于 WebGL 实现的经典 Milkdrop 音乐可视化工具,原为 Winamp 的插件。它支持通过麦克风或音频输入在浏览器中实时生成可视化效果,并内置大量预设风格。该项目以可嵌入的 JavaScript 库形式提供,已被 Webamp 等项目采用。 该项目以现代、易用的形式重现了备受喜爱的复古软件,使网页音乐播放器和直播能够融入动态视觉效果。它降低了开发者在网页应用中添加复杂音频可视化的门槛,促进了开源社区的创造力。与 Webamp 的集成展示了经典桌面体验如何被忠实地复刻到网页上。 Butterchurn 使用 WebGL 进行硬件加速渲染,并支持原始的 Milkdrop 预设格式(.milk 文件)。它既可作为独立可视化工具在 butterchurnviz.com 上使用,也可通过 JavaScript 库集成。该项目基于 MIT 许可证开源,并在 GitHub 上积极维护。它需要支持 WebGL 的现代浏览器,并支持实时音频输入或预录音轨。

@GitHub_Daily原推文1 张图片还有多少朋友记得当年用 Winamp 播放音乐时,屏幕上那种跟着节奏翻涌的迷幻画面。 butterchurn 把那套叫 Milkdrop 的老牌可视化器,用网页技术在浏览器里复刻了出来。 打开网页接上麦克风或者音频,画面就跟着音乐实时变化,内置大量预设风格能随手切换。 GitHub:http://github.com/jberg/butterchurn 它本身也是个能嵌进网页的库,Winamp 的网页复刻版 Webamp 等不少项目都在用它。 想给自己的音乐播放器或者直播加点视觉效果,可以拿它试试。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

还有多少朋友记得当年用 Winamp 播放音乐时,屏幕上那种跟着节奏翻涌的迷幻画面。 butterchurn 把那套叫 Milkdrop 的老牌可视化器,用网页技术在浏览器里复刻了出来。 打开网页接上麦克风或者音频,画面就跟着音乐实时变化,内置大量预设风格能随手切换。 GitHub:http://github.com/jberg/butterchurn 它本身也是个能嵌进网页的库,Winamp 的网页复刻版 Webamp 等不少项目都在用它。 想给自己的音乐播放器或者直播加点视觉效果,可以拿它试试。

背景
Milkdrop 是由 Ryan Geiss 于 2001 年为 Winamp 媒体播放器创建的传奇音乐可视化插件。它以其迷幻、随节拍变化的视觉效果和丰富的预设库而闻名。Winamp 本身是 1990 年代末至 2000 年代初的主流媒体播放器,以其可定制性和插件生态著称。Webamp 是 Winamp 2.9x 的 HTML5/JavaScript 重制版,在浏览器中忠实再现了经典界面和功能。Butterchurn 在此基础上将视觉组件带入现代网页标准。
社区讨论
社区表现出中等兴趣,对 Milkdrop 可视化效果及其网页复兴表示怀旧赞赏。一些用户深情回忆经典 Winamp 时代,另一些则看到了在现代网页音频项目中的实际应用。对开源复古技术重现普遍持热情态度。

7月23日 04:00在 X 打开#web audio #visualization #open source #retro tech #JavaScript

126.0

与Bitget/Safepal合作的Fiat24卡进入维护状态

与Bitget和Safepal合作发行的Fiat24卡已进入维护状态。此前,由于合规要求,Fiat24已于2026年6月暂停中国大陆新用户注册。这两件事是否有关联尚不清楚。 此次维护可能预示着加密支付卡在合规方面面临更深层次的挑战,尤其是在中国等监管严格的地区。这可能影响依赖此类卡进行数字资产消费的用户,并凸显了加密创新与监管合规之间的持续紧张关系。 Fiat24卡是一张可通过Fiat24 dApp充值的万事达借记卡,使用NFT作为申请和使用的凭证。与Bitget和Safepal的合作旨在提升用户体验并简化数字资产管理,但目前尚无关于维护时长或原因的具体细节。

@Pluvio9yte

卧槽,和Bitget / Safepal合作的Fiat24卡进入维护了 此前(2026年6月)Fiat24 已因合规要求暂停中国大陆新用户开户。不知道这两件事有没有关联。

背景
Fiat24是一个代币化支付平台,提供连接传统金融与加密货币的万事达借记卡。Bitget是一家加密货币交易所,Safepal是硬件和软件钱包提供商;它们与Fiat24的合作于2025年7月宣布,旨在改善交易和资产管理。2026年6月,Fiat24因合规要求暂停中国大陆新用户注册,反映出该地区对加密服务监管环境的收紧。

7月23日 04:16在 X 打开#crypto #fintech #compliance #Bitget #Safepal