8月4日2026 · 星期二

从 33 条抓取中筛选 12 条 · twitter × 5 账号 · 01:33 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. OpenAI 发布十项数学进展的形式化证明与推理过程9.0
  2. OpenAI 内部模型以约 2000 美元成本解决 10 个数学/计算机科学开放问题9.0
  3. 阿里通义千问发布2.4万亿参数开源多模态旗舰模型Qwen3.8-Max9.0
  4. AI推理工程:利润丰厚的中间商市场8.0
  5. OpenAI 重建 GPT-Live 语音堆栈,实现连续低延迟对话8.0
  6. 通义千问3.8-Max在视觉竞技场排名第二,仅落后Claude 13分8.0
  7. SenseNova U1.5-Lite-Preview:开源8B多模态模型,支持4K图像生成8.0
  8. 严格验收标准防止AI编程代理跑偏7.0
  9. 开发者分享使用 Fable 5 和 Codex 的高性价比多智能体工作流7.0
  10. 阿里巴巴通义千问宣布聚焦视觉智能体7.0
  11. Qwen基础模型团队在Twitter举办AMA活动7.0
  12. MakePlay 推出免费 AI 游戏构建器,通过文本提示生成完整游戏7.0
019.0

OpenAI 发布十项数学进展的形式化证明与推理过程

OpenAI 发布了十项数学进展的手稿、形式化 Lean 证明证书和推理过程,涵盖球体填充、编码理论和群论等领域。其中值得注意的是,成果包括非 sofic 群的存在性证明以及高维球体填充界限的指数级改进。这一发布使数学家能够验证并基于这些 AI 辅助的发现进行进一步研究。 此次发布标志着 AI 驱动数学研究的重要一步,表明语言模型能够助力解决长期悬而未决的难题。通过提供形式化 Lean 证明,OpenAI 确保了结果可被严格验证,这可能会加速形式化验证在数学中的采用。非 sofic 群的存在性等突破解决了数十年的问题,并可能对密码学和量子复杂性等领域产生影响。 这十项进展涵盖多个领域:球体填充、编码理论、群论、量子复杂性、格密码学和极值组合学。非 sofic 群的结果解决了一个 27 年的开放问题,而球体填充工作则对渐近界限提供了指数级改进。Lean 证书允许使用 Lean 证明助手进行独立验证,推理过程则揭示了 AI 解决问题的思路。

@OpenAI原推文We’re releasing the manuscripts, formal Lean certificates, and reasoning walkthroughs so mathematicians can examine these results and build on their ideas. https://openai.com/index/ten-advances-in-mathematics/ --- From twitter --- The results span sphere packing, coding theory, group theory, quantum complexity, lattice cryptography, extremal combinatorics, and more. Among them: establishing the existence of non-sofic groups and exponential improvements to bounds on high dimensional sphere packing.展开原推文收起原推文

@OpenAI

We’re releasing the manuscripts, formal Lean certificates, and reasoning walkthroughs so mathematicians can examine these results and build on their ideas. https://openai.com/index/ten-advances-in-mathematics/ --- From twitter --- The results span sphere packing, coding theory, group theory, quantum complexity, lattice cryptography, extremal combinatorics, and more. Among them: establishing the existence of non-sofic groups and exponential improvements to bounds on high dimensional sphere packing.

Ten advances in mathematics and theoretical computer scienceopenai.com · 直连原文
背景
Lean 是一种证明助手和函数式编程语言,用于数学定理的形式化验证。形式化验证确保证明在逻辑上正确且可由机器检查。Sofic 群是一类近似有限群的群;非 sofic 群的存在性自 1998 年以来一直是一个重要的开放问题。球体填充研究如何在给定空间中排列不重叠的球体,高维界限对编码理论和密码学有重要影响。

8月3日 18:54在 X 打开#OpenAI #mathematics #Lean #AI research #formal verification

029.0

OpenAI 内部模型以约 2000 美元成本解决 10 个数学/计算机科学开放问题

OpenAI 宣布其下一代主要模型的一个内部版本(称为 Astra 或 GPT-5.6 Sol)在数学和理论计算机科学领域长期存在的开放问题上取得了 10 项新成果。这些解决方案的生成仅使用了约 2000 美元的 GPT-5.6 Sol API 费率计算资源。成果涵盖几何、密码学和复杂性等领域,且论证已在 Lean 证明助手中形式化。 这一突破表明,AI 模型现在能够以极低的成本为困扰人类研究者多年的难题提供原创解决方案。这标志着 AI 推理能力的重大飞跃,可能加速数学和计算机科学领域的研究。在 Lean 中形式化证明的能力也指明了一条通往可验证的 AI 生成数学的道路,这可能会改变研究的开展和验证方式。 所使用的模型是 OpenAI 下一代主要模型的内部版本,很可能是 GPT-5.6 Sol,该模型尚未普遍可用。2000 美元的成本基于 API 定价,即每百万输入 token 5 美元,每百万输出 token 30 美元,上下文窗口为 1,050,000 token。解决的问题包括几何、密码学和复杂性方面的进展,解决方案已在 Lean 证明助手中形式化以确保正确性。然而,关于具体问题和模型推理过程的细节仍然很少。

@OpenAI

An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates.

背景
OpenAI 的 GPT 系列是大型语言模型,以生成类人文本而闻名。“Sol” 变体可能强调推理和问题解决能力。数学和理论计算机科学中的开放问题是众所周知且多年来一直未解的难题。Lean 是一个证明助手和编程语言,用于形式化数学证明,使计算机能够检查其正确性。在 Lean 中形式化证明是一个严格的过程,可确保不存在逻辑漏洞。

8月3日 18:54在 X 打开#AI #OpenAI #Mathematics #Research #Breakthrough

039.0

阿里通义千问发布2.4万亿参数开源多模态旗舰模型Qwen3.8-Max

阿里通义千问发布了其迄今最强大的模型Qwen3.8-Max,拥有2.4万亿参数,并具备原生多模态智能。该模型展示了自主编程能力,在10多天内从零开始独立完成了一个完整项目。Qwen3.8-Max和较小规模的Qwen3.8-27B的开源权重将于下周发布。 该发布为开源权重AI模型树立了新标杆,将大规模参数与自主编程、多模态能力相结合。通过开源权重,阿里降低了尖端AI的使用门槛,使开发者和初创公司能够以较低成本构建高级应用。该模型的长程规划和自我纠错能力有望加速芯片设计、电子商务等复杂领域的自动化进程。 Qwen3.8-Max是一个混合专家(MoE)模型,总参数量2.4万亿,定价为每百万输入token 2.0美元,每百万输出token 6.0美元,隐式缓存每百万token 0.25美元。其价格比前代Qwen3.7便宜20%。该模型支持将视觉作为规划与执行的持续反馈循环,并已展示出超过500轮的芯片设计优化和365天的电商策略规划能力。

@Alibaba_Qwen串推 6 条6 段 · 6 张图片📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:https://github.com/qwen-code-dev-bot/oh-my-cli - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: https://qwen.ai/blog?id=qwen3.8 ✅ Qwen Studio: https://chat.qwen.ai/?models=qwen3.8-max ⚡ API: https://www.qwencloud.com/models/qwen3.8-max原推文媒体预览+5展开原推文收起原推文

@Alibaba_Qwen串推 6 条

📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:https://github.com/qwen-code-dev-bot/oh-my-cli - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: https://qwen.ai/blog?id=qwen3.8 ✅ Qwen Studio: https://chat.qwen.ai/?models=qwen3.8-max ⚡ API: https://www.qwencloud.com/models/qwen3.8-max

LM Performance

VL Performance

LM Performance - English Version

VL Performance - English Version

背景
Qwen是阿里的大型语言模型系列,与GPT-4、DeepSeek等模型竞争。“开源权重”意味着公开训练好的参数,任何人都可以运行和微调模型,但训练数据和代码可能不完全开放。混合专家(MoE)架构使用多个专门的子模型来提高效率和性能。自主编程智能体能够在最少人工干预下生成、调试和部署软件,是AI领域快速发展的方向。
社区讨论
社区反应非常积极,对开源权重发布和模型的自主编程演示感到兴奋。一些用户注意到其有竞争力的定价以及已集成到Venice和Command Code等平台。人们期待权重发布后的基准测试和实际应用验证。

8月3日 02:15在 X 打开#AI #LLM #Qwen #Open Source #Multimodal

048.0

AI推理工程:利润丰厚的中间商市场

@wquguru 发布的一条推文被 @dotey 转发,指出 AI 推理工程已成为一个繁荣的中间商市场。推文强调,技术快速迭代、信息不对称和充裕资本为优化模型服务的公司创造了机会,通过 prefill/decode 分离和投机解码等技术,可实现高达 10 倍的性能提升。 这一分析揭示了 AI 生态系统的重大经济转变,中间件公司通过弥合原始模型能力与生产级 API 之间的差距,能够获取巨大价值。它表明,基础设施优化而非单纯的模型开发,正成为一个价值数十亿美元的机会,影响着寻求经济高效 AI 部署的初创公司、云提供商和企业。 关键优化包括:1) Prefill/decode 分离,将计算密集的提示处理与逐 token 生成拆分到不同 GPU 上;2) KV 缓存复用,对重复内容跳过冗余计算;3) 投机解码,用小模型预测 token,再由大模型验证,速度提升 2-3 倍;4) 量化至 FP4/FP8,吞吐量可提升 20% 而精度几乎无损;5) 对新开源模型的 Day-0 支持,需在数小时内完成适配。这些组合可将 token 生成速度从 30-40 tokens/s 提升至 300-400 tokens/s。

@wquguru@dotey 转推AI 同时满足了一个中间商市场繁荣的所有条件:技术变化足够快,信息差足够大,资本足够多,故事足够性感。如果把大模型训练、推理、应用整条产业链拆开来看,有些价值上百亿美金的机会是3年之前甚至完全不存在的。最典型的就是推理工程。 三年前这个词几乎没人提,今天它已经是独立学科:核心问题是把训好的权重,变成又快、又稳、又便宜的生产级API。几个关键概念,看完就知道为什么中间商能吃这么大: 1. Prefill vs Decode 分离 输入很长时,先算一遍整个prompt(prefill),再一个个生成token(decode)。两者算力特征完全不同,现在直接拆到不同GPU上跑,效率暴增。 2. Cache-aware Routing + KV Cache复用 用户发来20万token的请求,系统先问:这段内容我之前算过吗?有现成KV Cache就直接跳过重复计算。缓存命中率决定成本和延迟。 3. Speculative Decoding(投机解码) 用一个小模型先猜大模型接下来要说什么,猜对了就直接用,猜错了再纠正。小模型便宜,而且整体速度可提升2-3倍。 4. 量化(Quantization) 把模型从FP16压到FP4/FP8,很多人以为精度必掉。但实际中不同层的误差会相互抵消,有时吞吐量涨20%,基准分数几乎不变。 5. Day-0支持新模型 开源模型一发布,中间商要在几小时内完成量化、投机头训练、内核适配、多机并行……否则就错过热度。这本身就是一门高壁垒手艺。 这些优化叠加起来,能把同一个模型从30-40 tokens/s 推到300-400 tokens/s,最高近10倍。中间层吃的,就是这从能跑到跑得极致的巨大价差。 技术变化越快,信息差越大,中间商越香。推理工程只是这条链上最早长出百亿公司的典型例子,后面还会有更多此类初创公司出现。展开原推文收起原推文

@dotey 转推了

@wquguru

AI 同时满足了一个中间商市场繁荣的所有条件:技术变化足够快,信息差足够大,资本足够多,故事足够性感。如果把大模型训练、推理、应用整条产业链拆开来看,有些价值上百亿美金的机会是3年之前甚至完全不存在的。最典型的就是推理工程。 三年前这个词几乎没人提,今天它已经是独立学科:核心问题是把训好的权重,变成又快、又稳、又便宜的生产级API。几个关键概念,看完就知道为什么中间商能吃这么大: 1. Prefill vs Decode 分离 输入很长时,先算一遍整个prompt(prefill),再一个个生成token(decode)。两者算力特征完全不同,现在直接拆到不同GPU上跑,效率暴增。 2. Cache-aware Routing + KV Cache复用 用户发来20万token的请求,系统先问:这段内容我之前算过吗?有现成KV Cache就直接跳过重复计算。缓存命中率决定成本和延迟。 3. Speculative Decoding(投机解码) 用一个小模型先猜大模型接下来要说什么,猜对了就直接用,猜错了再纠正。小模型便宜,而且整体速度可提升2-3倍。 4. 量化(Quantization) 把模型从FP16压到FP4/FP8,很多人以为精度必掉。但实际中不同层的误差会相互抵消,有时吞吐量涨20%,基准分数几乎不变。 5. Day-0支持新模型 开源模型一发布,中间商要在几小时内完成量化、投机头训练、内核适配、多机并行……否则就错过热度。这本身就是一门高壁垒手艺。 这些优化叠加起来,能把同一个模型从30-40 tokens/s 推到300-400 tokens/s,最高近10倍。中间层吃的,就是这从能跑到跑得极致的巨大价差。 技术变化越快,信息差越大,中间商越香。推理工程只是这条链上最早长出百亿公司的典型例子,后面还会有更多此类初创公司出现。

@wquguru

一个残酷的真相,目前大部分 AI 创业的公司都不怎么赚钱,甚至利润都不如曲曲大女人卖自己的 skill。 所以发现一个有意思的事情,很多公司表面是一个业务,仔细一聊,“原来你也是卖 Token 的呀”,“原来你也是卖算力的呀”,原来大模型公司也倒卖算力赚差价呀。 真正赚钱的就还是皮条客们。 FA、撮合老股、倒 B300、卖 Token、卖数据集、卖算力,甚至卖一个能见到某位创始人的机会…… AI 同时满足了一个中间商市场繁荣的所有条件:技术变化足够快,信息差足够大,资本足够多,故事足够性感。

背景
LLM 推理包含两个阶段:prefill 处理整个输入提示以构建键值(KV)缓存,decode 则利用该缓存逐个生成 token。传统上两者在同一 GPU 上运行,但分离它们可优化资源利用。KV 缓存存储中间注意力结果以避免重复计算。投机解码通过使用更小、更快的模型提议 token,再由大模型验证,从而加速生成。量化降低模型精度以减少内存和计算成本,通常质量损失可忽略。这些技术对于大规模高效部署大模型至关重要。
社区讨论
该推文引发共鸣,许多人认为许多 AI 初创公司本质上是在转售算力或 token,真正利润被中间商获取。一些人指出推理优化是高壁垒技能,另一些人则争论随着技术成熟,这种中间商模式是否长期可持续。

8月4日 00:57在 X 打开#AI inference #LLM optimization #startups #infrastructure #economics

058.0

OpenAI 重建 GPT-Live 语音堆栈,实现连续低延迟对话

OpenAI 为 GPT-Live 重建了从客户端到模型的整个语音堆栈,实现了边听边说的连续对话能力。新架构为音频提供了专用的快速通道,并以异步方式处理深度推理和工具调用,确保对话不被中断。此外,语音会话的启动时间从六次网络往返减少到仅一次。 此次更新使与 ChatGPT 的语音交互更加自然和灵敏,缩小了与人际对话的差距。通过让模型在说话时也能倾听,并在后台处理推理,它实现了可扩展至数百万用户的实时、可打断的对话。这为语音 AI 界面树立了新标准,并可能加速其在客服、虚拟助手和免提应用中的普及。 新系统基于全双工架构,意味着音频输入和输出可以同时进行。专用的快速通道使音频流不等待推理完成,而深度思考和工具调用则异步运行。会话启动延迟从六次往返减少到一次,可能通过连接复用或预热实现。技术博文详细介绍了他们如何实现跨模型实例的无缝切换,以处理长时间会话。

@OpenAI串推 3 条3 段 · 2 张图片GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model. This new architecture keeps audio flowing continuously, so deeper reasoning and tool use don't interrupt the conversation.原推文媒体预览+1展开原推文收起原推文

@OpenAI串推 3 条

GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model. This new architecture keeps audio flowing continuously, so deeper reasoning and tool use don't interrupt the conversation.

Audio moves through a dedicated fast path, while deeper reasoning and tool use happen asynchronously. We also reduced voice-session startup from six network round trips to one.

The result is a faster, more natural conversation with ChatGPT Voice from the moment a session starts. How we built it: https://openai.com/index/continuous-voice-interaction-with-gpt-live/

背景
传统语音助手以半双工、轮流方式进行:先听、处理、再回应,这会产生不自然的停顿。全双工系统允许同时听和说,但大规模实现技术难度高。GPT-Live 是 OpenAI 为实时对话设计的语音模型,此次重建解决了之前导致交互感觉机械的延迟和连续性问题。异步推理意味着模型可以在与用户互动的同时进行思考,类似于人类在对话中处理信息的方式。

8月3日 20:38在 X 打开#OpenAI #voice AI #real-time interaction #architecture #GPT-Live

068.0

通义千问3.8-Max在视觉竞技场排名第二,仅落后Claude 13分

阿里巴巴的通义千问3.8-Max在视觉竞技场(Vision Arena)基准测试中以1305分排名第二,仅落后Claude Fable 5(High)13分。该模型还在其他领域表现强劲,在前端代码竞技场排名第四,在文本竞技场排名第二。这标志着通义千问系列在多模态能力上的重要里程碑。 这一成就表明,开源AI模型在复杂的视觉推理任务中能够与Claude等顶尖闭源模型紧密竞争。它标志着AI领域的一个转变:开放权重模型正在缩小性能差距,可能使先进的多模态AI更加普及。在多个竞技场的强劲表现表明,通义千问3.8-Max有望成为开发者和企业的多功能工具。 通义千问3.8-Max是一个拥有2.4万亿参数的混合专家(MoE)模型,上下文窗口达100万token,其开放权重计划于下周发布。在前端代码竞技场中,它获得1668分,仅次于Claude Opus 5(Max)和Kimi K3(Max),与Claude Opus 5(High)持平。视觉竞技场基准测试使用真实用户对话来评估开放式视觉推理,是衡量多模态理解能力的实用指标。

@Alibaba_Qwen引用推文1 张图片Appreciate it! Now let's understand the world through the eyes of Qwen3.8. 🥳原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

Appreciate it! Now let's understand the world through the eyes of Qwen3.8. 🥳

@arena

Qwen3.8-Max ranks #2 in Vision Arena scoring 1,305. Second only to Claude Fable 5 (High) which has only a 13pt lead.

背景
视觉竞技场是一个基准测试,根据模型在开放式对话中理解和推理图像的能力进行排名,使用人类偏好数据。前端代码竞技场评估模型根据设计稿或描述生成前端代码的能力。通义千问3.8-Max是阿里巴巴通义千问系列最新、能力最强的模型,被设计为能够处理文本、图像等多种数据类型的基础多模态模型。
社区讨论
社区反应积极,许多人强调开源模型与闭源领先者如此接近竞争的重要性。一些用户对即将发布的开放权重表示兴奋,另一些人则指出该模型在多个领域的强劲表现是阿里巴巴AI能力增长的标志。

8月3日 06:32在 X 打开#AI #Qwen #Vision Arena #model ranking #open-source

078.0

SenseNova U1.5-Lite-Preview:开源8B多模态模型,支持4K图像生成

商汤科技开源了SenseNova U1.5-Lite-Preview,这是一个轻量级8B多模态模型,在图像生成和编辑方面较前代U1有显著提升。它原生支持4K图像生成,在大画幅输出中细节清晰可见,并提供精确的文字编辑功能,能保留原有字体和材质。该模型还支持通过画框指定编辑区域,框外内容不受影响。 该发布表明,一个8B的开源模型在图像生成和编辑方面可与商业闭源模型媲美,降低了开发者和研究人员的门槛。原生4K支持和先进的文字渲染能力使其适用于海报、杂志设计等专业应用。通过将理解与生成统一于单一模型,它推动了高效、一体化多模态AI的前沿发展。 该模型基于NEO-unify架构,采用新的patch编码/解码层,并使用混合专家(MoE)设计,在运行时仅激活选定的专家以提高效率。它在理解和生成基准测试中均达到开源模型中的最先进水平。模型已在GitHub、Hugging Face和魔搭社区上提供,权重和代码均可公开获取。

@GitHub_Daily原推文2 张图片今年 4 月,商汤发布的原生统一多模态模型 SenseNova U1,图像理解、推理、生成和编辑在一个模型里打通。 经几个月迭代,今天其轻量升级版 U1.5-Lite-Preview 正式开源,图像生成与编辑能力大幅提升。 仅 8B 大小,在多项基准测试里,图像生成与编辑效果明显超越 U1,甚至能比肩商用闭源模型。 这次更新,原生支持 4K 图像生成,超大画幅下的文字、图标等细节放大都能看得清楚。 中英文文字生成与复杂版式组织也更稳了,海报、杂志内页、信息图都能一次成型。 - GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md - Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview 除此之外,编辑能力提升也非常大,能有效避免单次抽卡,哪里不对改哪里。 修改图中文字时,会保持原有的字体和材质,还能画框指定编辑区域,框外内容不受影响。 一次生成不再是终点,在结果上反复改文案、调版式、补元素,改到满意为止。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

今年 4 月,商汤发布的原生统一多模态模型 SenseNova U1,图像理解、推理、生成和编辑在一个模型里打通。 经几个月迭代,今天其轻量升级版 U1.5-Lite-Preview 正式开源,图像生成与编辑能力大幅提升。 仅 8B 大小,在多项基准测试里,图像生成与编辑效果明显超越 U1,甚至能比肩商用闭源模型。 这次更新,原生支持 4K 图像生成,超大画幅下的文字、图标等细节放大都能看得清楚。 中英文文字生成与复杂版式组织也更稳了,海报、杂志内页、信息图都能一次成型。 - GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md - Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview - 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview 除此之外,编辑能力提升也非常大,能有效避免单次抽卡,哪里不对改哪里。 修改图中文字时,会保持原有的字体和材质,还能画框指定编辑区域,框外内容不受影响。 一次生成不再是终点,在结果上反复改文案、调版式、补元素,改到满意为止。

背景
SenseNova U1于2026年4月由商汤科技发布,是首个将图像理解、推理、生成和编辑融合在单一架构中的原生统一多模态模型。与早期拼接多个模型的方法不同,U1从第一性原理出发采用统一范式。U1.5-Lite-Preview是迭代升级版,优化了训练数据和模型效率,使其更适用于实际应用,同时保持开源。

8月3日 10:00在 X 打开#AI #Multimodal #Open Source #Image Generation #SenseNova

087.0

严格验收标准防止AI编程代理跑偏

AI实践者@dotey分享了在AI编程工具中使用/goal命令的实用技巧:在每个阶段定义严格的验收标准,例如通过截图进行像素级UI对比,以防止AI跑偏。他通过一个迁移任务演示了这一点:在没有标准时AI交付了差强人意的结果,但加入像素差异验证后,AI逐步修正UI直至与原版一致。 这一建议解决了AI辅助编程中的常见痛点:当任务模糊时,代理往往会偷工减料或偏离需求。通过强制执行具体、可衡量的验收标准(如像素级对比),开发者可以显著提高输出质量并减少手动返工,使AI编码工作流在生产中更加可靠。 /goal命令在Claude Code和Codex等工具中可用,允许代理持续运行直到满足条件。@dotey的方法是在每个阶段截图并与原版UI进行像素差异对比,确保AI在输出视觉上完全一致前不会停止。他还指出,Codex的现代上下文压缩减少了交接的需要,但严格的标准对于防止AI偷懒仍然至关重要。

@dotey串推 2 条2 段/goal 用好的关键在于设计好严格的验收标准,每个阶段不仅说清楚任务目标是什么,还要说清楚怎么算是通过验收,这样才不容易跑偏 > 引用 @tancai1437: @dotey 宝玉大佬,使用goal,如何让他不跑偏呢展开原推文收起原推文

@dotey串推 2 条

/goal 用好的关键在于设计好严格的验收标准,每个阶段不仅说清楚任务目标是什么,还要说清楚怎么算是通过验收,这样才不容易跑偏 > 引用 @tancai1437: @dotey 宝玉大佬,使用goal,如何让他不跑偏呢

@tancai1437

@dotey 宝玉大佬,使用goal,如何让他不跑偏呢

比如我这个例子就是在迁移的时候,每个阶段去截图对比像素差异,简单粗暴但有效 https://x.com/dotey/status/2083620270959480931?s=20 > 引用 @dotey: 为了节约上下文 handoff 新开 Session,这在半年一年前是很好的实践,现在没太有必要,因为 codex 自己上下文压缩做的很好了,或者 /compact 一下继续就足够了。 > > 当然如果关系不大的任务,还是新开 Session 更好。 > > 当然除此之外 handoff 还是适用于跨 Agent session 的,比如 Claude Code 里面没完成的 session 让 Codex 继续。 > > 不过我更习惯于 Claude Code 里面用 Fable 5 写技术方案文档,然后反复 Review、修改后把文档交给 Codex,配合 /goal 让它按照文档执行推进。 > > 当然设置好严格的验收标准也很有必要,否则它会偷懒。 > > 之前一个迁移任务没有设置验收标准,它就给我交付了一个差强人意的,离我要求的还有比较大差距。(参考图1) > > 重新加上了验收标准:UI 界面像素要和原版完全一致,那么它每一步都会截图对比像素差异,直到完全一致(或者可以忽略的差异)

背景
/goal命令是AI编程代理中的一项功能,允许它们自主朝着定义的目标工作,迭代直至完成。如果没有明确的验收标准,代理可能会产生不完整或错误的结果。像素级对比是前端开发中的一种技术,通过在像素级别比较UI元素来确保精确的视觉保真度。Claude Code和Codex是流行的AI编码工具;Fable 5是Anthropic最新的模型,为Claude Code提供动力,以处理复杂、长时间运行的任务而闻名。

8月3日 23:25在 X 打开#AI coding #prompt engineering #workflow #Claude Code #Codex

097.0

开发者分享使用 Fable 5 和 Codex 的高性价比多智能体工作流

一位开发者详细介绍了一个实用工作流:由 Fable 5 编写技术方案,Codex 负责执行,再由 Fable 5 进行验收。该方法通过文档传递上下文,并策略性地使用 /compact 命令来降低成本。工作流还对比了使用 Opus 5 作为替代方案,指出 GPT-5.6 Sol 在稳定性和 token 效率上更优。 该工作流展示了如何协调多个 AI 智能体来完成复杂软件任务,同时兼顾质量与成本。它为采用智能体编码工具的开发者提供了可操作的模式,有望提高生产力并降低 API 费用。模型之间的对比有助于从业者为每个角色选择合适的工具。 该工作流使用 Fable 5 生成技术方案文档,然后交给 Codex(GPT-5.6 Sol xhigh)执行。方案确认后,发送 /compact 命令压缩对话,利用提示缓存降低成本。对于复杂任务,可为 Codex 添加 /goal 以避免反复 continue。Fable 5 随后验证实施情况,任何反馈都会发回同一 Codex 会话进行完善。开发者发现 Opus 5 在稳定性和 token 持久性上不如 GPT-5.6 Sol。

@dotey原推文4 张图片现在我很多复杂一点的任务都是 Fable 5 写方案,Codex 去执行,Fable 5 验收,相对来说可以做出比较靠谱的方案,以及兼顾性价比。具体是这么做的: 1. Fable 5 的产出是技术方案文档(图1) 一方面文档方便批注修改,另一方面文档方便其他 Agent 快速上手 2. 文档确认后在当前先 /compact 一次 这一步不是必要的,但是有好处,因为后续还要在同一会话去验证,/compact 压缩后,节约后续的上下文空间,之所以讨论方案就马上发送 /compact,因为这时候 Prompt Caching 还在,成本低,后面缓存过期了 compact 要贵一点。 3. 把文档交给 Codex (GPT-5.6 Sol xhigh)去执行(图2) 如果任务明显比较复杂,我一般会加上 /goal,这样中间就不需要反复去 continue,一次性把任务完成 4. Codex 完成后让 Fable 验证(图3) 直接告诉 Fable 其他 Agent 已经实施了,让它确认有没有遗漏,或者方向有无偏离。 如果有些遗漏之类的,把 Fable 的反馈发回给 Codex(图4),不需要新开会话,在同一个 Codex 会话,Codex 会根据反馈继续完善。 --- 如果用 Opus 5 替代 GPT 5.6 也可以,做法上可以跟上面一样新开会话,用文档传递上下文。 也可以直接让 Fable 5 开 SubAgent 并指定用 Opus 5 模型,并且要求在 SubAgent 完成任务后验证。 但是我执行下来 Opus 5 不如 GPT 5.6 Sol 稳定,也不如 GPT 5.6 Token 耐用,所以宁愿麻烦一点。原推文媒体预览+3展开原推文收起原推文

@dotey

现在我很多复杂一点的任务都是 Fable 5 写方案,Codex 去执行,Fable 5 验收,相对来说可以做出比较靠谱的方案,以及兼顾性价比。具体是这么做的: 1. Fable 5 的产出是技术方案文档(图1) 一方面文档方便批注修改,另一方面文档方便其他 Agent 快速上手 2. 文档确认后在当前先 /compact 一次 这一步不是必要的,但是有好处,因为后续还要在同一会话去验证,/compact 压缩后,节约后续的上下文空间,之所以讨论方案就马上发送 /compact,因为这时候 Prompt Caching 还在,成本低,后面缓存过期了 compact 要贵一点。 3. 把文档交给 Codex (GPT-5.6 Sol xhigh)去执行(图2) 如果任务明显比较复杂,我一般会加上 /goal,这样中间就不需要反复去 continue,一次性把任务完成 4. Codex 完成后让 Fable 验证(图3) 直接告诉 Fable 其他 Agent 已经实施了,让它确认有没有遗漏,或者方向有无偏离。 如果有些遗漏之类的,把 Fable 的反馈发回给 Codex(图4),不需要新开会话,在同一个 Codex 会话,Codex 会根据反馈继续完善。 --- 如果用 Opus 5 替代 GPT 5.6 也可以,做法上可以跟上面一样新开会话,用文档传递上下文。 也可以直接让 Fable 5 开 SubAgent 并指定用 Opus 5 模型,并且要求在 SubAgent 完成任务后验证。 但是我执行下来 Opus 5 不如 GPT 5.6 Sol 稳定,也不如 GPT 5.6 Token 耐用,所以宁愿麻烦一点。

背景
Fable 5 是 Anthropic 的 Claude 模型,专为自主、长时间运行的智能体任务设计,常用于规划和分析。Codex 是 OpenAI 的 AI 编码智能体,可通过 CLI、IDE 集成和 ChatGPT 使用,能够编写和调试代码。提示缓存是一种存储和重用提示前缀以降低 API 成本和延迟的功能,由 Anthropic 于 2024 年推出,其他平台也有提供。/compact 命令是一些 AI 编码环境中用于压缩对话历史的工具,可节省上下文窗口空间和成本。

8月3日 19:32在 X 打开#AI agents #workflow optimization #Codex #Fable 5 #software development

107.0

阿里巴巴通义千问宣布聚焦视觉智能体

阿里巴巴的通义千问团队宣布将聚焦于视觉智能体,标志着其战略转向开发能够感知并基于视觉信息采取行动的AI智能体。该消息通过其官方X(原推特)账号发布,但未披露具体技术细节或产品时间表。 此举顺应了将视觉与智能体能力相结合的行业趋势,模型不仅能理解图像,还能执行计算机操作或手机控制等任务。这可能加速面向企业自动化、机器人和消费级应用的更自主AI系统的开发,并对Kimi K2.5等视觉智能体领域的竞争对手构成挑战。 尽管公告缺乏细节,但通义千问现有的Qwen2.5-VL模型已支持动态工具使用和视觉定位等视觉智能体能力。新的聚焦可能基于此基础,并可能与Qwen-Agent框架集成。未提供发布日期、基准测试或定价信息。

@Alibaba_Qwen

Visual agentic intelligence

背景
视觉智能体是指结合计算机视觉与智能体能力的AI系统,使其能够感知视觉环境并采取行动以实现目标。这一概念随着Kimi K2.5等支持原生多模态输入和智能体集群的模型而日益受到关注。通义千问是阿里巴巴的大语言和视觉语言模型系列,其中Qwen2.5-VL是其旗舰视觉模型,能够作为视觉智能体执行计算机操作等任务。

8月3日 02:15在 X 打开#AI #visual AI #agents #Alibaba

117.0

Qwen基础模型团队在Twitter举办AMA活动

Qwen基础模型团队通过其新账号@QwenDevs在Twitter上宣布举办'Ask Me Anything'(AMA)活动。这是他们首次在该平台上直接与社区互动,邀请开发者和研究人员提问。 此次AMA表明这个重要的开源LLM团队致力于透明度和社区驱动开发。它为与Qwen创建者直接对话提供了难得的机会,可能影响未来模型方向并增强信任。 该AMA通过Qwen官方推文宣布,引用了新的@QwenDevs账号。未提供具体日期或形式细节,但团队的消息暗示这是一场开放式问答。Qwen模型参数规模从0.6B到235B不等,涵盖语言、视觉、音频、代码、数学和推理等领域。

@Alibaba_Qwen引用推文1 张图片🔥Let's talk about Qwen! #AMA原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

🔥Let's talk about Qwen! #AMA

@QwenDevs

git init qwen_devs README.md: Hey 👋 We're the folks from Qwen Foundation Model Team. Since we finally have an account...an AMA?

背景
Qwen是阿里巴巴开发的一系列开源基础模型,以在基准测试中的强劲表现而闻名。AMA代表'Ask Me Anything',是社交媒体上流行的形式,个人或团队公开回答问题。Qwen团队最近推出了Qwen 2.5以及Qwen2.5-Coder和Qwen2.5-Math等专用模型。

8月3日 03:20在 X 打开#Qwen #LLM #AMA #open-source #AI

127.0

MakePlay 推出免费 AI 游戏构建器,通过文本提示生成完整游戏

MakePlay 正式发布,这是一个免费的浏览器端 AI 游戏构建器,用户只需输入一句文本提示,平台即可自动生成完整的游戏,包括代码、美术、音乐、音效和关卡设计。该工具支持多种游戏类型,如第一人称射击、开放世界、竞速、解谜和平台跳跃,并允许用户通过自然语言指令进行迭代修改。 该产品的发布大幅降低了游戏开发的门槛,让任何有创意的人无需编程或美术技能即可制作可玩游戏。这标志着 AI 辅助创作的重要进步,有望使游戏设计大众化,并催生新一轮的用户生成内容。其免费、基于浏览器的特性消除了成本和硬件障碍,使全球用户都能轻松创作游戏。 MakePlay 完全在浏览器中运行,无需游戏引擎、素材或安装设置。它提供“分支开发”功能,允许用户在同一游戏中尝试不同的设计思路并对比实际体验。该平台目前免费,但长期定价或限制尚未公布。用户创建的“越跑越龙”(一款肉鸽跑酷游戏)被作为单句提示生成游戏的示例展示。

@Pluvio9yte引用推文2 个视频发现一个宝藏平台 AI game builder @makeplayai,只需要输入一句指令,就能帮你完成美术开发,音效设计,动效实现,从0到1直接实现一款属于你自己的小游戏——关键是全程免费! 整个开发过程全部在浏览器中就能实现,我最喜欢的是它的分支开发功能,可以把不同的想法塞进同一款游戏,然后对比实际游玩体验那种方案更有趣。 我写的这个游戏叫越跑越龙,大伙也可以在平台上搜一下,体验一下我一句话生成的游戏,肉鸽跑酷。原推文媒体预览+1展开原推文收起原推文

@Pluvio9yte

发现一个宝藏平台 AI game builder @makeplayai,只需要输入一句指令,就能帮你完成美术开发,音效设计,动效实现,从0到1直接实现一款属于你自己的小游戏——关键是全程免费! 整个开发过程全部在浏览器中就能实现,我最喜欢的是它的分支开发功能,可以把不同的想法塞进同一款游戏,然后对比实际游玩体验那种方案更有趣。 我写的这个游戏叫越跑越龙,大伙也可以在平台上搜一下,体验一下我一句话生成的游戏,肉鸽跑酷。

@makeplayai

MakePlay is officially live! You don't write code. You direct games. 🎬 Type one sentence — "a shiba pixel runner with double jump" — and an AI crew builds the whole thing: code, art, music, sound effects, level design, all at once. No engine, no assets, no setup. From FPS to open world — racing, puzzle, space shooter, platformer. Then keep directing in plain language. Make the boss slower. Make the music heavier. Soften the jump sound. Completely free. Runs in any browser. 🕹️ https://makeplay.ai/?utm_source=twitter

背景
传统游戏开发通常需要掌握编程语言、Unity 或 Unreal 等游戏引擎以及素材创作工具。像 MakePlay 这样的 AI 游戏构建器利用生成式 AI 自动化这些流程,通过解读自然语言提示来生成可玩游戏。这种方法属于无代码和 AI 驱动创作工具的大趋势,旨在让非专业人士也能完成复杂任务。类似的平台还有 Astrocade,同样能将文字描述转化为游戏。
社区讨论
社区反响积极,用户称赞该平台易于使用,能快速将游戏创意原型化。一些人对分支开发功能表示兴奋,认为便于对比设计选择。但目前尚未出现详细的技术讨论或批评性反馈。

8月3日 04:49在 X 打开#AI game development #no-code #generative AI #game builder #launch