9月3日2026 · 星期四

从 33 条抓取中筛选 12 条 · twitter × 5 账号 · 02:10 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. Anthropic 开源 Claude Code 的 /claude-api 技能8.0
  2. 谷歌发布 Gemini 3.8 Flash 及网络安全专用变体8.0
  3. OpenAI API 迹象表明 gpt-6-astra 即将发布8.0
  4. Qwen3.8-Max-0902 登顶 Code Arena 并以 5 美元/百万 Token 领跑帕累托前沿8.0
  5. Microduck:采用强化学习运动控制的开源机器鸭8.0
  6. 研究人员通过提示注入攻破 Claude Code Opus 5 自动模式8.0
  7. Claude Code 技巧:禁用 1M 上下文并运行 /doctor 以降低 token 消耗7.0
  8. 开发者使用 Claude Design 为 BaoCut v2 制作原型并集成本地 Agent CLI7.0
  9. Hy4火爆程度超预期,开发者放假期间服务被挤爆7.0
  10. effective-html:让编码 Agent 构建结构优先 HTML 原型的六项技能7.0
  11. 开发者打造面向幼儿的免费3D史前动物博物馆7.0
  12. 小说家 Hugh Howey 开源无干扰写作工具 NEO7.0
018.0

Anthropic 开源 Claude Code 的 /claude-api 技能

Anthropic 发布了一个开源的 /claude-api 技能,并已内置到 Claude Code 中。它提供三个主要子命令——cost-optimize、prompt-audit 和 migrate——帮助开发者优化 API 使用、审计提示词中的反模式,并支持 8 种语言的代码迁移。该技能已在 GitHub 上公开:github.com/anthropics/skills。 该技能直接解决了基于 Claude API 开发的常见痛点:成本上升、提示词过时和迁移困难。通过将结构化工作流嵌入 Claude Code,它降低了优化生产级 AI 应用的门槛,并与最近的 Fable 5.1 版本相契合——该版本提示词缓存价格下降了 75%,低 effort 性能也有所提升。对于 Agent 开发者和扩大 Claude API 使用规模的团队来说,这一技能尤其有价值。 该技能支持 Python、TypeScript、Java、Go、Ruby、C#、PHP 和 cURL,覆盖 Messages API 和 Managed Agents。cost-optimize 命令分析实际使用模式并给出按优先级排序的省钱建议;prompt-audit 扫描验证仪式、强调增强语、过时示例等反模式;migrate 命令处理模型版本间的破坏性变更,例如从 Fable 5 迁移到 5.1 或从 Opus 4.6 升级到 4.8。此外还有第四个命令 managed-agents-onboard,提供交互式引导来搭建 Managed Agent。

@dotey引用推文1 张图片Anthropic 刚开源了一个 /claude-api 的 skill,内置到了 Claude Code。 这个 Skill 的使用场景是帮你优化 Claude API 调用的,针对 Agent 开发或者基于 Claude API 开发,如果你只是 Claude Code 用户,那么不需要管,或者你不是用的 Claude 模型,那效果估计要差一点,但也会有效果。 使用方法很简单,在 Claude Code 里输入 /claude-api 加子命令,就能触发对应的诊断或迁移流程。 它的代码在 GitHub 上公开:http://github.com/anthropics/skills/blob/main/skills/claude-api/SKILL.md 这个 skill 本身不是一个独立工具,而是一组结构化的参考文档和工作流指令。当 Claude Code 检测到你的项目里 import 了 Anthropic SDK,或者你主动输入 /claude-api,它就会把对应语言(Python、TypeScript、Java、Go、Ruby、C#、PHP 或 cURL)的 API 文档加载到上下文里,让 Claude 在帮你写代码时有准确的 API 知识可用。 支持 8 种语言,覆盖两个开发面:Messages API(常规的请求、流式输出、工具调用、批量处理、提示词缓存等)和 Managed Agents(Anthropic 托管的有状态 Agent,带沙箱环境)。 三个主要的子命令 /claude-api cost-optimize 分析你项目的实际 API 使用情况,按优先级排列省钱建议。它不是给你一份通用清单,而是看你具体的用量模式,逐项提出修改方案,你可以逐条批准或跳过。检查的项目包括缓存配置、Token 冗余、批量处理机会、effort 级别和模型选择。 /claude-api prompt-audit 扫描项目里的提示词和 skill 文件,找出针对当前模型来说已经过时或有问题的写法。比如过度验证(让模型反复确认自己的输出)、多余的强调语句、过时的 few-shot 示例、自相矛盾的规则。产出两样东西:一份审计报告(标出具体文件、行号和问题模式),以及一个修改建议的 diff。 /claude-api migrate 帮你把现有的 Claude API 代码迁移到更新的模型。它会先确认范围(哪些文件需要改),再逐个文件分类,然后按目标模型的 breaking changes 列表逐项处理。比如从 Fable 5 迁移到 Fable 5.1,或从 Opus 4.6 升级到 4.8,涉及的参数变化、废弃字段、新的默认行为,都会在这个流程里覆盖到。 这些命令在 Fable 5.1 发布的背景下尤其有用。Fable 5.1 的提示词缓存价格降了 75%,但你得先确认自己的缓存配置没有问题才能真正省到钱。cost-optimize 就是干这个的。同样,Fable 5.1 在低 effort 下就能达到上一代高 effort 的水平,但如果你的提示词里还塞着大量为旧模型写的验证指令和脚手架,实际效果就打折扣。prompt-audit 帮你清理这些。 除了这三个,还有一个 /claude-api managed-agents-onboard,用于从零搭建一个 Managed Agent,走一个交互式的引导流程。 如果你需要做 Claude 模型 API 的优化,值得试试。 --- 附加(翻译自原推):常见提示词“反模式” (anti-patterns): 1. 流于形式的“验证仪式” (Verification rituals)。 诸如“仔细检查你的工作”或“在回答前核对两次”这类指令,往往会被前沿模型从字面上死板理解。这不仅没必要,还会白白浪费你的 tokens。 2. 用力过猛的强调与“详尽感” (Thoroughness and emphasis boosters)。 “尽可能详尽”、“关键注意:你必须永远……”这类强调语,在指导前沿模型时,反而会导致模型变得异常啰嗦,甚至去执行大量不必要的工具调用。 3. 强制性的流程与“草稿本”脚手架 (Mandatory procedures and scratchpad scaffolds)。 强制性的固定步骤(比如“在草稿本 (scratchpad) 中一步步思考”)或者思维模板,对于前沿模型来说完全是多此一举。这些人为强加的“脚手架”会与模型原生的推理能力重叠,从而白白消耗掉不必要的词元。 4. 过时的示例 (Stale examples)。 有些少样本示例 (few-shot examples)(注释:在提示词中提供少量示范例子,以便让模型模仿学习的一种常见技巧) 往往是针对老一代模型常犯的错误来设计的。如果拿这些去教前沿模型,反而会让它在原本很简单、根本不需要复杂思考的任务上,刻意模仿出冗长的推理链条。 5. 自相矛盾的规则 (Contradictory rules)。 前沿模型在遵循指令方面非常听话。如果你给出的指令本身存在矛盾(例如同时规定“始终在政策范围内退款”和“未经上报绝不退款”),模型会非常实在地去执行这些冲突的规则,最终导致整体表现大打折扣。 6. 过时的配置 (Dated configuration)。 为老一代 Claude 编写的设置(例如手动设置思考预算 (thinking budgets)),在配合新一代模型使用时,可能会直接被 Claude 平台拒绝访问。 随着时间的推移,这些反模式会在你的提示词中不断累积。当你将大语言模型升级到最新版本时,它们就会在暗中悄悄拖累整体性能。这背后的一个常见原因是:前沿模型太擅长遵循指令了,以至于这些糟糕的规则反而会误导它们,让它们把精力花在毫无意义的地方,花费不必要的 Token。 举个真实案例:在一个内部的客户服务基准测试 (benchmark) 中,测试了从 Opus 4.8 升级到 Opus 5 的情况。结果发现,在使用 Opus 5(以及像 Fable 5.1 这样的其他前沿模型)时,那些所谓的“验证仪式”(比如“核对两次”)会让模型重复劳动,浪费大量的 Token。而那些“强调增强语”(比如“尽可能详尽”)则会触发几十次完全没必要的系统搜索。 执行提示词审计 (prompt audits) 可以显著提升大语言模型的性能并降低成本。原推文媒体预览展开原推文收起原推文

@dotey

Anthropic 刚开源了一个 /claude-api 的 skill,内置到了 Claude Code。 这个 Skill 的使用场景是帮你优化 Claude API 调用的,针对 Agent 开发或者基于 Claude API 开发,如果你只是 Claude Code 用户,那么不需要管,或者你不是用的 Claude 模型,那效果估计要差一点,但也会有效果。 使用方法很简单,在 Claude Code 里输入 /claude-api 加子命令,就能触发对应的诊断或迁移流程。 它的代码在 GitHub 上公开:http://github.com/anthropics/skills/blob/main/skills/claude-api/SKILL.md 这个 skill 本身不是一个独立工具,而是一组结构化的参考文档和工作流指令。当 Claude Code 检测到你的项目里 import 了 Anthropic SDK,或者你主动输入 /claude-api,它就会把对应语言(Python、TypeScript、Java、Go、Ruby、C#、PHP 或 cURL)的 API 文档加载到上下文里,让 Claude 在帮你写代码时有准确的 API 知识可用。 支持 8 种语言,覆盖两个开发面:Messages API(常规的请求、流式输出、工具调用、批量处理、提示词缓存等)和 Managed Agents(Anthropic 托管的有状态 Agent,带沙箱环境)。 三个主要的子命令 /claude-api cost-optimize 分析你项目的实际 API 使用情况,按优先级排列省钱建议。它不是给你一份通用清单,而是看你具体的用量模式,逐项提出修改方案,你可以逐条批准或跳过。检查的项目包括缓存配置、Token 冗余、批量处理机会、effort 级别和模型选择。 /claude-api prompt-audit 扫描项目里的提示词和 skill 文件,找出针对当前模型来说已经过时或有问题的写法。比如过度验证(让模型反复确认自己的输出)、多余的强调语句、过时的 few-shot 示例、自相矛盾的规则。产出两样东西:一份审计报告(标出具体文件、行号和问题模式),以及一个修改建议的 diff。 /claude-api migrate 帮你把现有的 Claude API 代码迁移到更新的模型。它会先确认范围(哪些文件需要改),再逐个文件分类,然后按目标模型的 breaking changes 列表逐项处理。比如从 Fable 5 迁移到 Fable 5.1,或从 Opus 4.6 升级到 4.8,涉及的参数变化、废弃字段、新的默认行为,都会在这个流程里覆盖到。 这些命令在 Fable 5.1 发布的背景下尤其有用。Fable 5.1 的提示词缓存价格降了 75%,但你得先确认自己的缓存配置没有问题才能真正省到钱。cost-optimize 就是干这个的。同样,Fable 5.1 在低 effort 下就能达到上一代高 effort 的水平,但如果你的提示词里还塞着大量为旧模型写的验证指令和脚手架,实际效果就打折扣。prompt-audit 帮你清理这些。 除了这三个,还有一个 /claude-api managed-agents-onboard,用于从零搭建一个 Managed Agent,走一个交互式的引导流程。 如果你需要做 Claude 模型 API 的优化,值得试试。 --- 附加(翻译自原推):常见提示词“反模式” (anti-patterns): 1. 流于形式的“验证仪式” (Verification rituals)。 诸如“仔细检查你的工作”或“在回答前核对两次”这类指令,往往会被前沿模型从字面上死板理解。这不仅没必要,还会白白浪费你的 tokens。 2. 用力过猛的强调与“详尽感” (Thoroughness and emphasis boosters)。 “尽可能详尽”、“关键注意:你必须永远……”这类强调语,在指导前沿模型时,反而会导致模型变得异常啰嗦,甚至去执行大量不必要的工具调用。 3. 强制性的流程与“草稿本”脚手架 (Mandatory procedures and scratchpad scaffolds)。 强制性的固定步骤(比如“在草稿本 (scratchpad) 中一步步思考”)或者思维模板,对于前沿模型来说完全是多此一举。这些人为强加的“脚手架”会与模型原生的推理能力重叠,从而白白消耗掉不必要的词元。 4. 过时的示例 (Stale examples)。 有些少样本示例 (few-shot examples)(注释:在提示词中提供少量示范例子,以便让模型模仿学习的一种常见技巧) 往往是针对老一代模型常犯的错误来设计的。如果拿这些去教前沿模型,反而会让它在原本很简单、根本不需要复杂思考的任务上,刻意模仿出冗长的推理链条。 5. 自相矛盾的规则 (Contradictory rules)。 前沿模型在遵循指令方面非常听话。如果你给出的指令本身存在矛盾(例如同时规定“始终在政策范围内退款”和“未经上报绝不退款”),模型会非常实在地去执行这些冲突的规则,最终导致整体表现大打折扣。 6. 过时的配置 (Dated configuration)。 为老一代 Claude 编写的设置(例如手动设置思考预算 (thinking budgets)),在配合新一代模型使用时,可能会直接被 Claude 平台拒绝访问。 随着时间的推移,这些反模式会在你的提示词中不断累积。当你将大语言模型升级到最新版本时,它们就会在暗中悄悄拖累整体性能。这背后的一个常见原因是:前沿模型太擅长遵循指令了,以至于这些糟糕的规则反而会误导它们,让它们把精力花在毫无意义的地方,花费不必要的 Token。 举个真实案例:在一个内部的客户服务基准测试 (benchmark) 中,测试了从 Opus 4.8 升级到 Opus 5 的情况。结果发现,在使用 Opus 5(以及像 Fable 5.1 这样的其他前沿模型)时,那些所谓的“验证仪式”(比如“核对两次”)会让模型重复劳动,浪费大量的 Token。而那些“强调增强语”(比如“尽可能详尽”)则会触发几十次完全没必要的系统搜索。 执行提示词审计 (prompt audits) 可以显著提升大语言模型的性能并降低成本。

skills/skills/claude-api/SKILL.md at main · anthropics/skillsgithub.com · 直连原文

@RLanceMartin

i recently added this command to the claude-api skill. run it in Claude Code to fix common prompting "anti-patterns" that can hobble frontier models: /claude-api prompt-audit patterns include: 1/Verification rituals. Instructions like "double-check your work” or "verify twice before responding” are often taken literally by frontier models and can waste tokens. 2/ Thoroughness and emphasis boosters. "Be maximally thorough," "CRITICAL: YOU MUST ALWAYS…" can lead to verbosity and extra tool calls when working with frontier models. 3/ Mandatory procedures and scratchpad scaffolds. Fixed step processes (e.g., "think step by step in a scratchpad") or reasoning templates are rituals that frontier models don't need. This scaffolding can stack on top of native reasoning and use unnecessary tokens. 4/ Stale examples. Few-shot examples tuned to an older model's failure modes can teach a frontier model to imitate long reasoning chains on requests that don't need them. 5/ Contradictory rules. Frontier models are better at instruction following. Contradictory instructions ("always refund within policy" vs. "never issue refunds without escalation") can be followed more literally by frontier models, resulting in degraded performance. 6/ Dated configuration. Settings written for an older Claude generation (e.g., manual thinking budgets) can be rejected by the Claude Platform with newer models. these patterns accumulate in prompts over time, and can quietly degrade performance when upgrading to newer models. a common reason is the frontier models are better at instruction following, so these anti-patterns steer them to spend unnecessary tokens. example: i tested a migration from Opus 4.8 to Opus 5 on an internal customer support benchmark. with Opus 5 (and other frontier models like Fable 5.1), verification rituals ("verify twice") use unnecessary tokens by duplicating work. emphasis boosters ("be maximally thorough") become dozens of unneeded searches. applying prompt audits can improve performance and reduce cost (as shown in example attached and will be sharing a full write-up soon). also, the skill is also open source and some of this guidance likely applies generally across frontier models https://github.com/anthropics/skills/tree/main/skills/claude-api https://x.com/petergyang/status/2094987791566622971?s=20

背景
Claude Code 是 Anthropic 的智能体编码工具,在终端中运行,并可通过技能(结构化的参考文档和工作流指令)进行扩展。Claude API 包括用于无状态请求的 Messages API 和用于长时间运行、有状态 Agent 任务的 Managed Agents。Fable 5.1 是 Claude 最近发布的模型版本,将提示词缓存成本降低了 75%,并提升了低 effort 性能,使得优化变得更加重要。

9月3日 01:53在 X 打开#Anthropic #Claude Code #API optimization #AI development #open source

028.0

谷歌发布 Gemini 3.8 Flash 及网络安全专用变体

谷歌发布了 Gemini 3.8 Flash,这是六周内推出的第三个 Flash 模型,同时发布了专门的网络安全变体 3.8 Flash Cyber。新 Flash 模型在 DeepSWE v1.1 上取得 73.7% 的成绩,几乎追平 Claude Opus 5 的 74%,并超过 GPT-5.6 Sol 和 Claude Sonnet 5。3.8 Flash Cyber 仅通过新的 Fairwind 计划向经过审核的政府机构、关键基础设施运营商和安全研究人员开放。 Flash 模型的快速迭代表明谷歌在竞争激烈的 AI 智能体和编程市场中积极进取,而 Pro 系列却迟迟未发布。网络安全变体满足了自动化漏洞检测和修复的关键需求,有望降低防御网络威胁的时间和成本。3.8 Flash 的提示词注入攻击成功率低至 5.5%,使其成为构建处理不可信内容的 AI 智能体时更安全的选择。 Gemini 3.8 Flash 的定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,这是促销价,2026 年底后将翻倍。谷歌将基准测试的提升归因于模型“更努力地工作”——采取更多步骤和工具调用,从而增加 token 消耗。3.8 Flash Cyber 在 CyberGym 漏洞发现上取得 86.2%,在 20 种编程语言中成功率超过 70%,在 CWE-Bench 自动修补上 pass@1 达到 47.2%。在实际测试中,Chrome 安全团队发现它修复的漏洞数量是最佳商用大模型的 2.6 倍,Wiz 报告召回率提高 7.5–9.7%,成本降低 2.3–5.2 倍。

@dotey引用推文4 张图片Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。 Google 最近这个发布节奏很有意思。7 月底发 3.6 Flash,8 月中发 3.7 Flash,今天又发 3.8 Flash,间隔都只有大约三周。而与此同时,今年 6 月本该发布的 Gemini 3.5 Pro 至今没有出现。Google 在 Flash 这条线上疯狂迭代,但更高端的 Pro 系列迟迟没有动静。 再加上 8 月初 DeepMind 经历了一轮震荡,创始人兼 CEO Demis Hassabis 从日常管理退出,转任 DeepMind 主席和 Alphabet 首席科学家,首席科学家 Jeff Dean 也离职创业。新任 SVP Koray Kavukcuoglu 接管了 Gemini 的开发。这种背景下连续推 Flash,不知道是不是某种程度上的刷存在感。 回到模型本身。 3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。 注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。 跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复杂工程问题能力的评测)上拿到 73.7%,仅比 Claude Opus 5 的 74% 低 0.3 个百分点,超过了 GPT-5.6 Sol 的 72.7%、Claude Sonnet 5 的 53.8%,以及上代 3.7 Flash 的 65.3%。 至于为什么评分高,Google 自己的解释是 3.8 Flash “works harder”,遇到复杂任务会多想几步、多调用几次工具,代价是消耗更多 Token。 另一个跑分细节:3.8 Flash 在 Gray Swan 提示词注入(prompt injection)评测中被攻破的概率只有 5.5%,对比 DeepSeek V4 Pro 的 60.1%、Grok 4.6 的 51.8%。也就是说,用 3.8 Flash 做 AI Agent 被恶意指令劫持的风险要低得多。 跟着 Gemini 3.8 Flash 一起发布的还有 3.8 Flash Cyber,这是一个专门为网络安全防御训练的模型,只通过 Google 新推出的 Fairwind Program 向经审核的政府机构、关键基础设施运营商和安全研究人员开放,目前全球有 650 多个合作伙伴。普通开发者用不了。 Google 把这个模型的能力框定在安全防御上,强调它擅长找漏洞和修漏洞,而非攻击利用。在 CyberGym 漏洞发现评测中,3.8 Flash Cyber 拿到 86.2%;在覆盖 20 种编程语言的内部评测中,漏洞发现成功率超过 70%。在 CWE-Bench 自动修补评测中,它以 47.2% 的 pass@1 逼近了前沿模型的 47.8%,但成本低得多。 一些实际应用案例: Chrome 安全团队发现 3.8 Flash Cyber 比最好的商用大模型多修复了 2.6 倍的 Chrome 漏洞; 安全公司 Wiz 的内部渗透测试中,它的召回率高出 7.5% 到 9.7%,成本却低了 2.3 到 5.2 倍; Google Cloud 漏洞研究团队用它在不到两小时内发现了一个关键漏洞,这类漏洞通常需要数月的人工研究。 3.8 Flash 已经可以通过 Gemini API、Google AI Studio、Android Studio、Antigravity 等渠道使用,Google AI Pro 和 Ultra 订阅用户在 Gemini App 中也能用上。企业版通过 Gemini Enterprise 接入。Cyber 版需要申请 Fairwind Program。原推文媒体预览+3展开原推文收起原推文

@dotey

Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。 Google 最近这个发布节奏很有意思。7 月底发 3.6 Flash,8 月中发 3.7 Flash,今天又发 3.8 Flash,间隔都只有大约三周。而与此同时,今年 6 月本该发布的 Gemini 3.5 Pro 至今没有出现。Google 在 Flash 这条线上疯狂迭代,但更高端的 Pro 系列迟迟没有动静。 再加上 8 月初 DeepMind 经历了一轮震荡,创始人兼 CEO Demis Hassabis 从日常管理退出,转任 DeepMind 主席和 Alphabet 首席科学家,首席科学家 Jeff Dean 也离职创业。新任 SVP Koray Kavukcuoglu 接管了 Gemini 的开发。这种背景下连续推 Flash,不知道是不是某种程度上的刷存在感。 回到模型本身。 3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。 注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。 跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复杂工程问题能力的评测)上拿到 73.7%,仅比 Claude Opus 5 的 74% 低 0.3 个百分点,超过了 GPT-5.6 Sol 的 72.7%、Claude Sonnet 5 的 53.8%,以及上代 3.7 Flash 的 65.3%。 至于为什么评分高,Google 自己的解释是 3.8 Flash “works harder”,遇到复杂任务会多想几步、多调用几次工具,代价是消耗更多 Token。 另一个跑分细节:3.8 Flash 在 Gray Swan 提示词注入(prompt injection)评测中被攻破的概率只有 5.5%,对比 DeepSeek V4 Pro 的 60.1%、Grok 4.6 的 51.8%。也就是说,用 3.8 Flash 做 AI Agent 被恶意指令劫持的风险要低得多。 跟着 Gemini 3.8 Flash 一起发布的还有 3.8 Flash Cyber,这是一个专门为网络安全防御训练的模型,只通过 Google 新推出的 Fairwind Program 向经审核的政府机构、关键基础设施运营商和安全研究人员开放,目前全球有 650 多个合作伙伴。普通开发者用不了。 Google 把这个模型的能力框定在安全防御上,强调它擅长找漏洞和修漏洞,而非攻击利用。在 CyberGym 漏洞发现评测中,3.8 Flash Cyber 拿到 86.2%;在覆盖 20 种编程语言的内部评测中,漏洞发现成功率超过 70%。在 CWE-Bench 自动修补评测中,它以 47.2% 的 pass@1 逼近了前沿模型的 47.8%,但成本低得多。 一些实际应用案例: Chrome 安全团队发现 3.8 Flash Cyber 比最好的商用大模型多修复了 2.6 倍的 Chrome 漏洞; 安全公司 Wiz 的内部渗透测试中,它的召回率高出 7.5% 到 9.7%,成本却低了 2.3 到 5.2 倍; Google Cloud 漏洞研究团队用它在不到两小时内发现了一个关键漏洞,这类漏洞通常需要数月的人工研究。 3.8 Flash 已经可以通过 Gemini API、Google AI Studio、Android Studio、Antigravity 等渠道使用,Google AI Pro 和 Ultra 订阅用户在 Gemini App 中也能用上。企业版通过 Gemini Enterprise 接入。Cyber 版需要申请 Fairwind Program。

@OfficialLoganK

Introducing Gemini 3.8 Flash, another jump in Gemini's agentic + coding capabilities, and our 3rd updated Flash model in only 6 weeks... This model has been a ton of fun to work with, excited to see what you all think!

背景
Gemini 是谷歌的多模态大语言模型系列,其中 Flash 变体针对速度和成本效率进行优化,而 Pro 模型则追求更高能力。DeepSWE 是一个用于长期软件工程任务的基准测试,要求自主解决问题。提示词注入是一种攻击方式,将恶意指令嵌入 AI 智能体处理的数据中,可能劫持其行为。Fairwind 计划是谷歌的新举措,旨在向可信防御者提供网络安全模型,取代之前受限的访问方式。
社区讨论
r/singularity 上的 Reddit 帖子显示总体反响积极,用户对快速的发布节奏和基准测试结果印象深刻。一些评论者对促销定价和 Pro 模型的缺失表示怀疑,另一些人则讨论网络安全变体在现实世界中的意义。少数人指出性能提升带来的 token 消耗代价。

9月2日 23:22在 X 打开#Gemini #Google #AI model release #DeepMind #cybersecurity

038.0

OpenAI API 迹象表明 gpt-6-astra 即将发布

来自 OpenAI Responses API 的证据表明,新模型 gpt-6-astra 已进入发布准备阶段。API 对 'gpt-6-astra' 返回 404 Not Found,而不存在的模型标识符返回 400 错误,这与已知即将发布的模型(如 5.6 Cyber)的模式一致。类似的异常曾在 Bedrock API 上用于在 Fable 5.1 发布前一天检测到该模型。 这表明 OpenAI 正准备推出 GPT-6 系列的新模型,可能带来能力的显著提升。依赖 OpenAI API 的开发者和企业可能需要规划迁移或兼容性测试。通过 API 错误码检测已暂存模型的方法已成为 AI 社区中可靠的预警信号。 OpenAI Responses API 对 'gpt-6-astra' 和 '5.6 Cyber'(已知即将发布的模型)返回 404,而对无效标识符返回 400。这一区别表明 'gpt-6-astra' 已被 API 识别但尚未公开可用。同样的技术曾在 Bedrock API 上用于在 Fable 5.1 发布前一天检测到该模型。目前尚无官方公告或确认的发布日期。

@dotey引用推文1 张图片看起来 gpt-6-astra 要发了原推文媒体预览展开原推文收起原推文

@dotey

看起来 gpt-6-astra 要发了

@synthwavedd

🚨 BREAKING: "gpt-6-astra" has been staged on the OpenAI API The OpenAI Responses API now returns a 404 Not Found for "gpt-6-astra", where garbage/actually non-existent slugs return 400s - a 404 is also returned for 5.6 Cyber, which we know exists. A similar quirk exists in the Bedrock API used to find Fable 5.1 a day prior to launch.

背景
OpenAI Responses API 是 2025 年 3 月发布的开发者工具,旨在简化智能体应用的构建。它根据模型标识符是否被识别返回不同的 HTTP 状态码:已知但不可用的模型返回 404,完全未知的标识符返回 400。开发者利用这一行为在官方公告前推断即将发布的模型。Bedrock API 是亚马逊的基础模型托管服务,在那里也观察到了类似的 API 异常。

9月2日 18:25在 X 打开#OpenAI #GPT-6 #AI model release #API

048.0

Qwen3.8-Max-0902 登顶 Code Arena 并以 5 美元/百万 Token 领跑帕累托前沿

阿里巴巴 Qwen 的 Qwen3.8-Max-0902 以 1691 分首次登顶 Code Arena: WebDev 排行榜,比 Claude Opus 5 (Max) 高 3 分,比上一代 Qwen3.8-Max 高 22 分。同时,该模型以 5 美元/百万 Token 的混合价格成为帕累托前沿上得分最高的模型,在性能与成本的权衡上优于 HY4 Preview 和 Qwen3.8-Flash-Next。 这一里程碑表明,模型可以同时实现顶级编码性能与成本效益,打破了高质量必然伴随高价格的假设。它加剧了 AI 编码模型之间的竞争,并可能加速 Qwen 在智能体编码工作流中的采用,尤其对追求高性能低成本的开发者具有吸引力。 Qwen3.8-Max-0902 在 Code Arena: WebDev 上获得 1691 分,在数据与分析、消费产品类别中排名第一,在其他多个类别中排名第二或第三。其混合价格为每百万 Token 5 美元,远低于 Claude Opus 5 (Max) 的 20 美元/百万 Token 和 Kimi K3 (Max) 的 12 美元/百万 Token。该模型是 Qwen3.8-Max 的升级快照,编码能力更强,可处理更复杂的工程级项目和长周期自主开发。尽管 Claude Opus 5 Max、Kimi K3 Max 和 Qwen3.8 Max 仍位居总榜第 2 至第 4 名,但它们已退出帕累托前沿,凸显了前沿对成本与性能平衡的重视。

@Alibaba_Qwen引用推文1 张图片🏆 #1 overall on Code Arena, and top of the Pareto frontier at $5/MToken. Thanks! @arena Give Qwen3.8-Max-0902 a spin on QwenCloud.🥳原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

🏆 #1 overall on Code Arena, and top of the Pareto frontier at $5/MToken. Thanks! @arena Give Qwen3.8-Max-0902 a spin on QwenCloud.🥳

@arena

Qwen3.8-Max-0902 by @Alibaba_Qwen just debuted at #1 overall in Code Arena: WebDev with 1,691 pts, and became the highest-scoring model on the Pareto frontier at a blended $5/MToken! On the updated frontier, Qwen3.8-Max-0902 sits above HY4 Preview (1,629 pts at $2.08/MToken) and Qwen3.8-Flash-Next (1,620 pts at $0.39/MToken). With this release, three models at the top of the overall leaderboard have moved off the Pareto frontier despite remaining #2–#4 overall: - Claude Opus 5 (Max): #2, 1,688 pts, $20/MToken - Kimi K3 (Max): #3, 1,674 pts, $12/MToken - Qwen3.8 (Max): #4, 1,669 pts, $5/MToken Congrats to the @Alibaba_Qwen team on the release!

背景
Code Arena: WebDev 是一个基于人类偏好的 AI 编码基准,评估模型生成 Web 应用的能力。在 AI 模型评估中,帕累托前沿代表在性能与成本之间提供最佳权衡的模型集合;前沿上的模型无法在两个指标上同时被超越。Qwen 是阿里巴巴的大语言模型系列,Qwen3.8-Max-0902 是近期针对编码和长周期自主开发优化的快照版本。5 美元/百万 Token 的混合价格反映了输入和输出 Token 成本的综合。

9月2日 02:57在 X 打开#AI #LLM #benchmark #coding #Alibaba

058.0

Microduck:采用强化学习运动控制的开源机器鸭

Pollen Robotics 推出了 Microduck,一款高 25 厘米、重 800 克的双足机器鸭,配备 15 个舵机、摄像头、激光雷达和可抓取物体的喙。它采用神经网络策略,在仿真环境中通过强化学习训练,再迁移到真实机器人(sim-to-real),控制循环频率为 50 Hz。该机器人能行走、捡东西、踢球、摔倒后自行站起,还能切换为带轮子的轮滑模式,整机售价 399 美元,软件完全开源。 Microduck 以消费级价格让足式机器人的 sim-to-real 强化学习变得触手可及,降低了爱好者和研究人员尝试学习型运动策略的门槛。其开源的训练配方和模块化行为切换(行走与轮滑)为在低成本硬件上开发和部署神经网络控制器提供了实用范例。这有望加速教育机器人和小规模具身智能领域的创新。 Microduck 高 25 厘米、重 800 克,15 个舵机由神经网络策略以 50 Hz 控制循环驱动。它配备摄像头、小型深度传感器、两个 IMU 和用于抓取的铰接式喙。该机器人预售价为 399 美元,其软件栈(包括仿真训练配方)在 GitHub 上完全开源。用户可在行走和轮滑模式之间切换,并通过游戏手柄或电脑蓝牙进行控制。

@GitHub_Daily原推文1 张图片一只开源版机器鸭,会走路、捡东西、踢球,摔倒了还能自己站起来,看完演示我都想买一只。 该机器鸭叫 Microduck,整机卖 399 美元,软件这层整个开源,感觉华强北很快就动手了。 鸭子身高 25 厘米、体重 800 克,15 个舵机由神经网络策略驱动,控制循环每秒跑 50 次,走得稳稳当当。 GitHub:http://github.com/pollen-robotics/microduck 走路靠的不是写死的动作,是在仿真环境里用强化学习练出来再搬到真身上,训练那套配方也一并开源了。 装上轮子按个键,它会换一套「脑子」改成滚着走。拿游戏手柄就能开,也能用蓝牙连电脑指挥。 拿来入门强化学习和机器人正合适,买不起人形机器人的,先养只鸭子过过瘾。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

一只开源版机器鸭,会走路、捡东西、踢球,摔倒了还能自己站起来,看完演示我都想买一只。 该机器鸭叫 Microduck,整机卖 399 美元,软件这层整个开源,感觉华强北很快就动手了。 鸭子身高 25 厘米、体重 800 克,15 个舵机由神经网络策略驱动,控制循环每秒跑 50 次,走得稳稳当当。 GitHub:http://github.com/pollen-robotics/microduck 走路靠的不是写死的动作,是在仿真环境里用强化学习练出来再搬到真身上,训练那套配方也一并开源了。 装上轮子按个键,它会换一套「脑子」改成滚着走。拿游戏手柄就能开,也能用蓝牙连电脑指挥。 拿来入门强化学习和机器人正合适,买不起人形机器人的,先养只鸭子过过瘾。

背景
强化学习(RL)是一种机器学习范式,智能体通过试错来学习决策,以最大化奖励。Sim-to-real 迁移指在仿真环境中训练策略,然后部署到物理机器人上,从而减少昂贵且有风险的真实世界训练需求。足式机器人由于动力学不稳定,控制难度大,因此学习型策略是一个活跃的研究领域。神经网络策略将传感器输入直接映射为电机指令,取代了传统的手工编写控制器。

9月2日 05:30在 X 打开#robotics #reinforcement learning #open-source #hardware #sim-to-real

068.0

研究人员通过提示注入攻破 Claude Code Opus 5 自动模式

安全研究员 Johann Rehberger 发表详细分析,表明 Claude Code Opus 5 在自动模式下可通过提示注入被诱骗执行攻击者控制的代码,成功率高达 80%。攻击方式包括要求模型总结恶意网站,该网站随后注入指令以绕过安全控制。Anthropic 回应称此行为符合设计预期。 该漏洞凸显了 AI 编码代理中提示注入的持续风险,尤其是在自动模式成为默认设置的情况下。它影响依赖 Claude Code 执行自主任务的开发者,因为来自网络或代码仓库的恶意内容可能导致代码执行、数据泄露或系统受损。这一发现强调了在代理工作流中需要强大的沙箱隔离和人工监督。 该攻击针对运行在自动模式下的 Opus 5,该模式自 8 月中旬起成为默认设置。自动模式使用 Sonnet-5 作为安全分类器,可根据严重程度阻止工具调用,但注入可绕过这些阻止。Rehberger 在带有 Docusaurus 网站的全新沙箱中演示了攻击,成功率高达 80%。Anthropic 坚称该行为是预期的,因为自动模式专为用户监督的环境设计。

背景
Claude Code 是 Anthropic 推出的 AI 辅助编码命令行工具,Opus 5 是其最新的大型语言模型。自动模式允许模型自主执行命令和编辑文件,减少用户批准的需求。提示注入是一种安全攻击,将恶意指令嵌入模型处理的内容中,导致其执行非预期操作。安全分类器是用于检测和阻止有害工具调用的次级模型或规则。

9月2日 22:19在 X 打开#AI #Claude #security #breaking-news

077.0

Claude Code 技巧:禁用 1M 上下文并运行 /doctor 以降低 token 消耗

一位用户分享了 Claude Code 的省 token 技巧:在 ~/.claude/settings.json 中设置 CLAUDE_CODE_DISABLE_1M_CONTEXT=1,禁用 1M 上下文窗口,强制会话使用 200K 窗口并自动压缩。此外,/doctor 命令可以清理无用的 skills、MCP 和过长的 CLAUDE.md 文件。该用户报告称两分钟内清除了 10K 常驻垃圾,估计每天节省 50 万 token,每月节省 1500 万 token。 对于重度 Claude Code 用户,token 消耗直接关系到成本和延迟。减少不必要的上下文并清理配置可以带来显著的月度节省,并通过避免长上下文退化来提高会话质量。这个技巧解决了 AI 辅助开发中 token 膨胀悄然累积的常见痛点。 CLAUDE_CODE_DISABLE_1M_CONTEXT 设置是在 Claude Code v2.1.50 中添加的,但有报告(例如 GitHub issue #63479)表明它在某些版本中可能被忽略,因此效果可能有所不同。/doctor 命令是一个交互式诊断工具,可检查安装、配置、连接和权限,并能自动修复问题。用户估计每月节省 1500 万 token 是基于每天 50 个 agent 会话、每个会话通过清理节省 10K token,再加上避免长上下文重复读取和压缩延迟带来的额外节省。

@dotey引用推文2 张图片/doctor 不错,确实有效果原推文媒体预览+1展开原推文收起原推文

@dotey

/doctor 不错,确实有效果

@wquguru

@dotey 老师给了一个节省Claude消耗的秘诀~/.claude/settings.json中设置 CLAUDE_CODE_DISABLE_1M_CONTEXT=1,禁用 1M 上下文,同时把部分模型会话按 200K 窗口来预算和自动压缩。还有一个几乎很少有人用到,但效果十分显著的技巧:/doctor。 它可以清掉没用的 skills、MCP、识别过长的 CLAUDE.md。我用它两分钟清掉了 10K 常驻垃圾占用。按一天 50 个 Agent Session 算:每天少烧 50 万 token,一个月少烧 1500 万 token。这还没算长上下文带来的反复读文件、延迟 compact、质量变差后的返工。

背景
Claude Code 是 Anthropic 的命令行 AI 编码助手。1M 上下文窗口允许模型一次处理最多 100 万个 token,但可能昂贵且缓慢;禁用它可强制使用较小的 200K 窗口并自动压缩。/doctor 命令是一个内置诊断工具,可检查 Claude Code 设置的健康状况并清理未使用的组件。Skills 和 MCP(模型上下文协议)服务器是扩展,如果一直启用,会随时间累积并消耗 token。

9月2日 04:20在 X 打开#Claude Code #token optimization #AI tools #productivity

087.0

开发者使用 Claude Design 为 BaoCut v2 制作原型并集成本地 Agent CLI

一位开发者分享了使用 Claude Design(通过本地 skill baoyu-design)为 BaoCut v2 新功能制作原型的流程。他们通过提示词让 Claude 从用户角度思考,并迭代优化原型,同时集成 Codex 和 Claude Code 等本地 Agent CLI,而不是自己构建 Harness。过程中包含多轮反馈,Claude 有时会反对开发者的建议。 这展示了一种实用且低成本的 AI 辅助原型制作方法,利用现有的本地 Agent CLI,避免了构建自定义基础设施的需要。它突显了开发者如何快速探索设计变更并将 Agent 能力集成到桌面应用中,这可能加速 AI 驱动工具的功能开发。该流程还展示了将 AI 视为能够挑战假设的设计协作者的价值。 开发者使用了 github.com/JimLiu/baoyu-design 的本地 skill,并用 Fable 5.1 进行测试。他们特别要求 Claude 重构左侧边栏以突出 Agent 入口,整合翻译/字幕入口,并移除右侧的 Agent 标签页。Claude 被指示保留现有的 LLM API 翻译功能但重新思考其形式。开发者提到一个账号达到 5 小时使用限额后切换到了另一个账号。

@dotey串推 2 条2 段 · 8 张图片我一直讲我在用 Claude Design (我是用的本地 skill http://github.com/JimLiu/baoyu-design )做原型,加新功能修改功能会先修改原型。 我来举个例子我是怎么为新功能做原型的。我正在开发 BaoCut 的 v2,还是决定加上 Agent 功能(打脸自己了),因为从用户角度来说,确实还是能从 App 直接调用 Agent 更方便,不过我不自己做 Harness,只是用本机已经安装好的 codex 或者 cluade code cli。 正好今天 Fable 5.1 发布,拿它来测试正好不过的。提示词很简单,基本上就是我想要什么。(参考图1) 第一轮下来结果就还不错了。(参考图2-图4) --- 我的提示词 ---- 帮我站在用户的角度重新思考 designs/baocut/BaoCut.html ,尤其是新用户如何更容易上手去优化原型结构,不要局限于当前的设计,跳出当前设计更多从用户功能角度思考。 把 Agent 提到左侧主入口:左侧有历史会话和最近项目,可以方便的进入agent新开会话(图片重点参考对话框和对话消息历史) Agent 底层是 Claude cli、Codex cli 等现成的 Harness 和订阅 要结合当前 baocut 的功能特点 打通翻译字幕等位置的入口 从右侧tab去掉agent tab 原有 LLM API 翻译等功能使用 API 调用 LLM 的保留,但是形式可以重新思考 请基于这个思路升级改造原型 > 引用 @dotey: https://x.com/i/article/2094620108811390976原推文媒体预览+7展开原推文收起原推文

@dotey串推 2 条

我一直讲我在用 Claude Design (我是用的本地 skill http://github.com/JimLiu/baoyu-design )做原型,加新功能修改功能会先修改原型。 我来举个例子我是怎么为新功能做原型的。我正在开发 BaoCut 的 v2,还是决定加上 Agent 功能(打脸自己了),因为从用户角度来说,确实还是能从 App 直接调用 Agent 更方便,不过我不自己做 Harness,只是用本机已经安装好的 codex 或者 cluade code cli。 正好今天 Fable 5.1 发布,拿它来测试正好不过的。提示词很简单,基本上就是我想要什么。(参考图1) 第一轮下来结果就还不错了。(参考图2-图4) --- 我的提示词 ---- 帮我站在用户的角度重新思考 designs/baocut/BaoCut.html ,尤其是新用户如何更容易上手去优化原型结构,不要局限于当前的设计,跳出当前设计更多从用户功能角度思考。 把 Agent 提到左侧主入口:左侧有历史会话和最近项目,可以方便的进入agent新开会话(图片重点参考对话框和对话消息历史) Agent 底层是 Claude cli、Codex cli 等现成的 Harness 和订阅 要结合当前 baocut 的功能特点 打通翻译字幕等位置的入口 从右侧tab去掉agent tab 原有 LLM API 翻译等功能使用 API 调用 LLM 的保留,但是形式可以重新思考 请基于这个思路升级改造原型 > 引用 @dotey: https://x.com/i/article/2094620108811390976

第一个版本我觉得存在一些问题,比如 Project 和 Session 关系不清楚,比如和右侧边的 AI Tool Tab 的关系不清晰。 所以我提出了修改意见(参考图1,之所以是新会话,是因为第一个账号到了 5 小时限额,不得不换账号) 注意我并没有让它严格按照我的要求做,而是让它提出自己的观点,不要一味执行,比如你看 图2 它就反对了我的一条观点。 新版本它根据讨论后的修改意见做了调整,然后我再对一些细节让它做了微调,几轮下来结果就还不错了(看图3-图4) --- 提示词 --- 帮我站在新用户的角度重新思考 @designs/baocut/BaoCut.html 设计,看怎么体验更友好。 重新梳理 Project 和 Agent Session 之间的关系,让它们能更无缝的切换 思考: 一个agent session会话是不是应该只和一个projects绑定,但是输入框应该能通过 @ 方便的引入其他 Project 作为上下文参考 如果一个会话只能绑定一个项目,是不是可以把最近会话和最近项目放一起,变成二级的,一级是项目,展开是 agent 会话? 重新思考 Project 中 AI Tools 功能,让它更好的和 Agent 打通,同时又能使用 Cloud Model API 重新思考 Home,是不是应该改成 Agent 入口? 重新设计左侧 Agent Skill 入口,可以合并到 Settings? Settings 里面添加对 Agent Providers 的设置(参考附图) --- 以上是我的问题和建议,你可以综合分析后给出你的见解

背景
Claude Design 是 Anthropic 推出的一项功能,帮助用户通过自然语言描述创建设计原型。像 baoyu-design 这样的本地 skill 通过允许使用本地安装的编码代理(如 Claude Code 或 Codex CLI)作为设计引擎来扩展这一功能。BaoCut 是一款本地优先的 macOS 应用,用于字幕编辑和视频剪辑,开发者正在开发集成 Agent 的 v2 版本。Codex CLI 是 OpenAI 的终端编码代理,而 Claude Code 是 Anthropic 的对应产品。

9月2日 02:50在 X 打开#AI-assisted design #prototyping #Claude #agent integration #workflow

097.0

Hy4火爆程度超预期,开发者放假期间服务被挤爆

腾讯的Hy4模型火爆程度远超预期,导致模型服务被挤爆。这一激增发生在开发团队放假期间,用户无法访问服务。过载还影响了其他模型,迫使Workbuddy依赖第三方API。 这一事件凸显了在缺乏充分容量规划的情况下推出热门开源模型所面临的基础设施挑战。它表明单一模型的成功如何给共享资源带来压力并中断依赖服务。对于AI社区而言,它强调了即使在假期也需要可扩展的部署和监控。 Hy4 preview是一个拥有7700亿参数的混合专家模型,激活参数490亿,上下文窗口超过100万token,在事件发生前约6天发布。过载严重到甚至影响了其他模型,Workbuddy不得不切换到第三方供应商API。开发团队正在休假,因此没有立即的修复措施。

@Pluvio9yte原推文1 张图片开发者放假放爽了,用户可就糟老罪了啊😭😭 Hy4 的火爆程度远远超出预期了,感觉不仅仅是因为性能表现好,应该是在腾讯自己 AI 全家桶里面都能免费体验,大伙都在凑热闹了。 这就很搞心态了啊,什么叫开发团队美美放假去了,结果用户闻风而来给模型服务挤爆了?? 我知道你们很累,但是先别急着累,大伙需要你们!现在的情况就是基本没得用,甚至其他模型都受到了影响,这两天的Workbuddy只能挂第三方供应商的API。原推文媒体预览展开原推文收起原推文

@Pluvio9yte

开发者放假放爽了,用户可就糟老罪了啊😭😭 Hy4 的火爆程度远远超出预期了,感觉不仅仅是因为性能表现好,应该是在腾讯自己 AI 全家桶里面都能免费体验,大伙都在凑热闹了。 这就很搞心态了啊,什么叫开发团队美美放假去了,结果用户闻风而来给模型服务挤爆了?? 我知道你们很累,但是先别急着累,大伙需要你们!现在的情况就是基本没得用,甚至其他模型都受到了影响,这两天的Workbuddy只能挂第三方供应商的API。

背景
腾讯Hy4 preview是新一代开源大语言模型,以其大规模和长上下文而著称。Workbuddy是一个集成多种AI模型的服务,允许用户通过统一接口访问它们。事件发生在Hy4发布后不久,当时许多用户同时尝试该模型,导致基础设施过载。

9月2日 13:57在 X 打开#Hy4 #AI model #service outage #Tencent #infrastructure

107.0

effective-html:让编码 Agent 构建结构优先 HTML 原型的六项技能

GitHub_Daily 分享了“effective-html”,这是一套教编码 Agent 创建 HTML 视觉产物的六项技能,从低保真线框图到可交互原型。这些技能旨在分离关注点:线框图、原型、计划图和架构图各有专门的技能,并有一个总入口将任务路由给合适的专家。该方法强调线框图应看起来未完成,以便评审者关注结构和流程而非样式。 这解决了 Agent 生成 UI 设计中的一个常见问题:当 Agent 生成精美、色彩丰富的页面时,评审者会被美学分散注意力,而无法评估底层结构。通过在低保真线框和高保真原型之间强制分离,effective-html 帮助团队在投入视觉设计之前验证信息架构和用户流程。这对于使用 AI 编码 Agent 的开发者来说意义重大,因为它提供了一种可复用的模式,用于生成支持更好产品决策的设计产物。 该仓库包含六项技能:线框图、原型、计划图、架构图,以及一个用于路由的总入口。原型仅实现一条可行的主流程和相关状态,所有输出均为自包含的单文件 HTML,可直接在浏览器中打开。这些技能无需安装即可作为参考手册使用,并且为 Claude Code 和 Codex 提供了一键安装的插件。该项目托管在 github.com/plannotator/effective-html。

@GitHub_Daily原推文1 张图片让编码 Agent 画个产品原型,出来的页面配色花哨交互酷炫,评审时大家光顾着评颜色,结构对不对反而没人看。 effective-html 是一套教 Agent 做 HTML 视觉产物的 Skill 集,从低保真线框图到能点的交互原型分工明确。 一共 6 个 Skill,线框图、原型、计划图、架构图各管一摊,还有一个总入口负责把活路由给对的专家。 GitHub:http://github.com/plannotator/effective-html 有意思的是它讲究「线框图就该长得没做完」,看的人自然把注意力放在结构和流程上,而不是纠结样式。 原型则只实现一条走得通的主流程和相关状态,产物全是自包含的单文件 HTML,浏览器打开就能用。 不装也能用,当参考手册翻着抄就行。Claude Code、Codex 也都有一键安装的插件。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

让编码 Agent 画个产品原型,出来的页面配色花哨交互酷炫,评审时大家光顾着评颜色,结构对不对反而没人看。 effective-html 是一套教 Agent 做 HTML 视觉产物的 Skill 集,从低保真线框图到能点的交互原型分工明确。 一共 6 个 Skill,线框图、原型、计划图、架构图各管一摊,还有一个总入口负责把活路由给对的专家。 GitHub:http://github.com/plannotator/effective-html 有意思的是它讲究「线框图就该长得没做完」,看的人自然把注意力放在结构和流程上,而不是纠结样式。 原型则只实现一条走得通的主流程和相关状态,产物全是自包含的单文件 HTML,浏览器打开就能用。 不装也能用,当参考手册翻着抄就行。Claude Code、Codex 也都有一键安装的插件。

背景
像 Claude Code 和 Codex 这样的编码 Agent 可以生成 HTML、CSS 和 JavaScript,但如果没有指导,它们往往会产生视觉上精美但结构有缺陷的原型。“技能”是可复用的指令集,通过特定的工作流程和质量门槛来扩展 Agent 的能力。线框图是低保真草图,专注于布局和信息层次,而原型是展示功能的交互模型。这些产物之间的关注点分离是以人为中心的设计中一种成熟的做法,但在 Agent 生成的输出中较少被强制执行。

9月2日 13:30在 X 打开#AI agents #HTML #UI design #coding tools #GitHub

117.0

开发者打造面向幼儿的免费3D史前动物博物馆

一位开发者在三岁女儿被充满追逐打斗的恐龙节目吓到后,创建了一个免费、无广告、无需注册的3D史前动物博物馆网站。该网站包含陆地、海洋和天空三个展区的24种史前动物,支持交互式旋转、按需播放的语音讲解、附有出处标注的家长指南,以及根据孩子身高显示等比例小人的体型对比工具。网站支持中英文切换,并适配手机、平板和电脑。 该项目填补了儿童教育媒体中的一个真实空白,为幼儿提供了一种平静、无威胁的方式来了解史前动物。它展示了如何利用网络技术创造无障碍、适合儿童且无商业干扰的教育体验。家长指南和体型对比工具的加入增加了教学价值,使其成为家庭和教育工作者的有用资源。 该博物馆是开源的,代码托管在GitHub上,24种动物按陆地、海洋和天空分区展示。语音讲解仅在点击时播放,避免突然出声吓到孩子。体型对比功能允许家长输入孩子身高,在动物旁边显示等比例的人体模型。所有信息均标注出处,界面支持中英文双语。

@GitHub_Daily原推文1 张图片作者三岁的女儿看电视里的恐龙总被吓到,节目净是追逐和搏斗,没有一个安静看动物的地方。 于是他做了一座网页上的 3D 史前动物博物馆,免费开放,不用注册没有广告,打开就能逛。 陆地、海洋、天空三个展区一共 24 位史前动物,用手指拖着转圈看,讲解要点了才播,不会突然出声吓到孩子。 GitHub:http://github.com/s010s/prehistoric-animal-museum 配了家长指南,孩子问「它吃什么」「化石在哪挖的」这类问题时能接得住,每条信息都标了出处。 最贴心的是「和我比一比」,输入孩子的身高,展厅里就站一个等比例的小人,恐龙到底多大一眼就有概念。 支持中英文切换,手机平板电脑都适配。家里有 2 到 6 岁小朋友的,周末可以带着一起逛逛。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

作者三岁的女儿看电视里的恐龙总被吓到,节目净是追逐和搏斗,没有一个安静看动物的地方。 于是他做了一座网页上的 3D 史前动物博物馆,免费开放,不用注册没有广告,打开就能逛。 陆地、海洋、天空三个展区一共 24 位史前动物,用手指拖着转圈看,讲解要点了才播,不会突然出声吓到孩子。 GitHub:http://github.com/s010s/prehistoric-animal-museum 配了家长指南,孩子问「它吃什么」「化石在哪挖的」这类问题时能接得住,每条信息都标了出处。 最贴心的是「和我比一比」,输入孩子的身高,展厅里就站一个等比例的小人,恐龙到底多大一眼就有概念。 支持中英文切换,手机平板电脑都适配。家里有 2 到 6 岁小朋友的,周末可以带着一起逛逛。

背景
史前动物,如恐龙、翼龙和海洋爬行动物,生活在数百万年前,媒体中常以戏剧性的追逐和打斗场景呈现,这可能会吓到幼儿。WebGL和Three.js等3D网络技术使得无需插件即可在浏览器中直接渲染交互式3D模型。虚拟博物馆已成为流行的教育工具,尤其适合儿童,让他们在家就能获得沉浸式学习体验。

9月2日 10:00在 X 打开#education #3D #web #children #museum

127.0

小说家 Hugh Howey 开源无干扰写作工具 NEO

畅销书《羊毛战记》作者 Hugh Howey 在 GitHub 上开源了 NEO。NEO 是一款专为小说家设计的极简写作应用,界面为空白页面,自动章节编号,并设有独特的“保留区”用于暂时存放写得好但不合时宜的段落。该工具支持 macOS 和 Windows,无需注册账号。 NEO 解决了写作者的一个真实痛点:功能繁重的文字处理器带来的干扰和阻力。通过开源,Howey 邀请写作和开发者社区共同参与一个从小说家视角出发的工具,可能影响写作软件的设计方向。其对写作流畅度和手稿结构的关注,使其有望成为开源创意工具包中的宝贵一员。 NEO 将手稿以纯文本文件形式存储在磁盘上,持续自动保存,每日打包备份保留两周。支持导出符合亚马逊出版规范的 EPUB 3 电子书,以及 Word 和 PDF 格式。界面在需要时才显示控件,按一次回车换段,两次插入分节符,三次开启新章。拼写检查仅在主动调用时出现,避免写作过程中出现打击信心的红色波浪线。

@GitHub_Daily原推文1 张图片一位小说家 Hugh Howey 开源了一款写作工具 NEO,README 里还自称「一个想当作家的人」,挺有意思。 装上就默认我们在写书,界面就一张白纸,控件不碰不出现,章节自动编号,排版就是成书的样子。 按一下回车换段,连按两下出分节符,三下直接开新章,就是要让人一直写下去。 GitHub:http://github.com/hughhowey/neo 最妙的是「舍不得删」功能,写得漂亮但碍事的段落拖进专门的收留区,哪天想通了还能一键放回原位。 拼写检查只在主动召唤时出现,写到一半不会有红波浪线跳出来打击信心。写作目标、每日冲刺、进度图也都有。 书稿是磁盘上的纯文本文件,连续自动保存,每天的打包备份保留两周,不用注册账号。 能导出符合亚马逊出版规范的 EPUB 3 电子书,Word、PDF 也行。macOS、Windows 都有安装包。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

一位小说家 Hugh Howey 开源了一款写作工具 NEO,README 里还自称「一个想当作家的人」,挺有意思。 装上就默认我们在写书,界面就一张白纸,控件不碰不出现,章节自动编号,排版就是成书的样子。 按一下回车换段,连按两下出分节符,三下直接开新章,就是要让人一直写下去。 GitHub:http://github.com/hughhowey/neo 最妙的是「舍不得删」功能,写得漂亮但碍事的段落拖进专门的收留区,哪天想通了还能一键放回原位。 拼写检查只在主动召唤时出现,写到一半不会有红波浪线跳出来打击信心。写作目标、每日冲刺、进度图也都有。 书稿是磁盘上的纯文本文件,连续自动保存,每天的打包备份保留两周,不用注册账号。 能导出符合亚马逊出版规范的 EPUB 3 电子书,Word、PDF 也行。macOS、Windows 都有安装包。

背景
Hugh Howey 是知名科幻作家,以《羊毛战记》系列闻名,该系列最初为自助出版作品。EPUB 3 是当前电子书的标准格式,支持高级排版和无障碍功能,亚马逊等主要零售商在某些出版流程中要求使用该格式。开源软件允许任何人查看、修改和贡献代码,促进社区驱动的开发。

9月2日 07:30在 X 打开#open-source #writing-tool #Hugh Howey #productivity #EPUB