- OpenAI 发布十项数学进展的形式化证明与推理过程9.0
- OpenAI 内部模型以约 2000 美元成本解决 10 个数学/计算机科学开放问题9.0
- 阿里通义千问发布2.4万亿参数开源多模态旗舰模型Qwen3.8-Max9.0
- AI推理工程:利润丰厚的中间商市场8.0
- OpenAI 重建 GPT-Live 语音堆栈,实现连续低延迟对话8.0
- 通义千问3.8-Max在视觉竞技场排名第二,仅落后Claude 13分8.0
- SenseNova U1.5-Lite-Preview:开源8B多模态模型,支持4K图像生成8.0
- 严格验收标准防止AI编程代理跑偏7.0
- 开发者分享使用 Fable 5 和 Codex 的高性价比多智能体工作流7.0
- 阿里巴巴通义千问宣布聚焦视觉智能体7.0
- Qwen基础模型团队在Twitter举办AMA活动7.0
- MakePlay 推出免费 AI 游戏构建器,通过文本提示生成完整游戏7.0
019.0
OpenAI 发布十项数学进展的形式化证明与推理过程
OpenAI 发布了十项数学进展的手稿、形式化 Lean 证明证书和推理过程,涵盖球体填充、编码理论和群论等领域。其中值得注意的是,成果包括非 sofic 群的存在性证明以及高维球体填充界限的指数级改进。这一发布使数学家能够验证并基于这些 AI 辅助的发现进行进一步研究。 此次发布标志着 AI 驱动数学研究的重要一步,表明语言模型能够助力解决长期悬而未决的难题。通过提供形式化 Lean 证明,OpenAI 确保了结果可被严格验证,这可能会加速形式化验证在数学中的采用。非 sofic 群的存在性等突破解决了数十年的问题,并可能对密码学和量子复杂性等领域产生影响。 这十项进展涵盖多个领域:球体填充、编码理论、群论、量子复杂性、格密码学和极值组合学。非 sofic 群的结果解决了一个 27 年的开放问题,而球体填充工作则对渐近界限提供了指数级改进。Lean 证书允许使用 Lean 证明助手进行独立验证,推理过程则揭示了 AI 解决问题的思路。
背景
Lean 是一种证明助手和函数式编程语言,用于数学定理的形式化验证。形式化验证确保证明在逻辑上正确且可由机器检查。Sofic 群是一类近似有限群的群;非 sofic 群的存在性自 1998 年以来一直是一个重要的开放问题。球体填充研究如何在给定空间中排列不重叠的球体,高维界限对编码理论和密码学有重要影响。
8月3日 18:54在 X 打开#OpenAI #mathematics #Lean #AI research #formal verification
029.0
OpenAI 内部模型以约 2000 美元成本解决 10 个数学/计算机科学开放问题
OpenAI 宣布其下一代主要模型的一个内部版本(称为 Astra 或 GPT-5.6 Sol)在数学和理论计算机科学领域长期存在的开放问题上取得了 10 项新成果。这些解决方案的生成仅使用了约 2000 美元的 GPT-5.6 Sol API 费率计算资源。成果涵盖几何、密码学和复杂性等领域,且论证已在 Lean 证明助手中形式化。 这一突破表明,AI 模型现在能够以极低的成本为困扰人类研究者多年的难题提供原创解决方案。这标志着 AI 推理能力的重大飞跃,可能加速数学和计算机科学领域的研究。在 Lean 中形式化证明的能力也指明了一条通往可验证的 AI 生成数学的道路,这可能会改变研究的开展和验证方式。 所使用的模型是 OpenAI 下一代主要模型的内部版本,很可能是 GPT-5.6 Sol,该模型尚未普遍可用。2000 美元的成本基于 API 定价,即每百万输入 token 5 美元,每百万输出 token 30 美元,上下文窗口为 1,050,000 token。解决的问题包括几何、密码学和复杂性方面的进展,解决方案已在 Lean 证明助手中形式化以确保正确性。然而,关于具体问题和模型推理过程的细节仍然很少。
背景
OpenAI 的 GPT 系列是大型语言模型,以生成类人文本而闻名。“Sol” 变体可能强调推理和问题解决能力。数学和理论计算机科学中的开放问题是众所周知且多年来一直未解的难题。Lean 是一个证明助手和编程语言,用于形式化数学证明,使计算机能够检查其正确性。在 Lean 中形式化证明是一个严格的过程,可确保不存在逻辑漏洞。
8月3日 18:54在 X 打开#AI #OpenAI #Mathematics #Research #Breakthrough
039.0
阿里通义千问发布2.4万亿参数开源多模态旗舰模型Qwen3.8-Max
阿里通义千问发布了其迄今最强大的模型Qwen3.8-Max,拥有2.4万亿参数,并具备原生多模态智能。该模型展示了自主编程能力,在10多天内从零开始独立完成了一个完整项目。Qwen3.8-Max和较小规模的Qwen3.8-27B的开源权重将于下周发布。 该发布为开源权重AI模型树立了新标杆,将大规模参数与自主编程、多模态能力相结合。通过开源权重,阿里降低了尖端AI的使用门槛,使开发者和初创公司能够以较低成本构建高级应用。该模型的长程规划和自我纠错能力有望加速芯片设计、电子商务等复杂领域的自动化进程。 Qwen3.8-Max是一个混合专家(MoE)模型,总参数量2.4万亿,定价为每百万输入token 2.0美元,每百万输出token 6.0美元,隐式缓存每百万token 0.25美元。其价格比前代Qwen3.7便宜20%。该模型支持将视觉作为规划与执行的持续反馈循环,并已展示出超过500轮的芯片设计优化和365天的电商策略规划能力。
背景
Qwen是阿里的大型语言模型系列,与GPT-4、DeepSeek等模型竞争。“开源权重”意味着公开训练好的参数,任何人都可以运行和微调模型,但训练数据和代码可能不完全开放。混合专家(MoE)架构使用多个专门的子模型来提高效率和性能。自主编程智能体能够在最少人工干预下生成、调试和部署软件,是AI领域快速发展的方向。
社区讨论
社区反应非常积极,对开源权重发布和模型的自主编程演示感到兴奋。一些用户注意到其有竞争力的定价以及已集成到Venice和Command Code等平台。人们期待权重发布后的基准测试和实际应用验证。
8月3日 02:15在 X 打开#AI #LLM #Qwen #Open Source #Multimodal
048.0
AI推理工程:利润丰厚的中间商市场
@wquguru 发布的一条推文被 @dotey 转发,指出 AI 推理工程已成为一个繁荣的中间商市场。推文强调,技术快速迭代、信息不对称和充裕资本为优化模型服务的公司创造了机会,通过 prefill/decode 分离和投机解码等技术,可实现高达 10 倍的性能提升。 这一分析揭示了 AI 生态系统的重大经济转变,中间件公司通过弥合原始模型能力与生产级 API 之间的差距,能够获取巨大价值。它表明,基础设施优化而非单纯的模型开发,正成为一个价值数十亿美元的机会,影响着寻求经济高效 AI 部署的初创公司、云提供商和企业。 关键优化包括:1) Prefill/decode 分离,将计算密集的提示处理与逐 token 生成拆分到不同 GPU 上;2) KV 缓存复用,对重复内容跳过冗余计算;3) 投机解码,用小模型预测 token,再由大模型验证,速度提升 2-3 倍;4) 量化至 FP4/FP8,吞吐量可提升 20% 而精度几乎无损;5) 对新开源模型的 Day-0 支持,需在数小时内完成适配。这些组合可将 token 生成速度从 30-40 tokens/s 提升至 300-400 tokens/s。
背景
LLM 推理包含两个阶段:prefill 处理整个输入提示以构建键值(KV)缓存,decode 则利用该缓存逐个生成 token。传统上两者在同一 GPU 上运行,但分离它们可优化资源利用。KV 缓存存储中间注意力结果以避免重复计算。投机解码通过使用更小、更快的模型提议 token,再由大模型验证,从而加速生成。量化降低模型精度以减少内存和计算成本,通常质量损失可忽略。这些技术对于大规模高效部署大模型至关重要。
社区讨论
该推文引发共鸣,许多人认为许多 AI 初创公司本质上是在转售算力或 token,真正利润被中间商获取。一些人指出推理优化是高壁垒技能,另一些人则争论随着技术成熟,这种中间商模式是否长期可持续。
8月4日 00:57在 X 打开#AI inference #LLM optimization #startups #infrastructure #economics
058.0
OpenAI 重建 GPT-Live 语音堆栈,实现连续低延迟对话
OpenAI 为 GPT-Live 重建了从客户端到模型的整个语音堆栈,实现了边听边说的连续对话能力。新架构为音频提供了专用的快速通道,并以异步方式处理深度推理和工具调用,确保对话不被中断。此外,语音会话的启动时间从六次网络往返减少到仅一次。 此次更新使与 ChatGPT 的语音交互更加自然和灵敏,缩小了与人际对话的差距。通过让模型在说话时也能倾听,并在后台处理推理,它实现了可扩展至数百万用户的实时、可打断的对话。这为语音 AI 界面树立了新标准,并可能加速其在客服、虚拟助手和免提应用中的普及。 新系统基于全双工架构,意味着音频输入和输出可以同时进行。专用的快速通道使音频流不等待推理完成,而深度思考和工具调用则异步运行。会话启动延迟从六次往返减少到一次,可能通过连接复用或预热实现。技术博文详细介绍了他们如何实现跨模型实例的无缝切换,以处理长时间会话。
背景
传统语音助手以半双工、轮流方式进行:先听、处理、再回应,这会产生不自然的停顿。全双工系统允许同时听和说,但大规模实现技术难度高。GPT-Live 是 OpenAI 为实时对话设计的语音模型,此次重建解决了之前导致交互感觉机械的延迟和连续性问题。异步推理意味着模型可以在与用户互动的同时进行思考,类似于人类在对话中处理信息的方式。
8月3日 20:38在 X 打开#OpenAI #voice AI #real-time interaction #architecture #GPT-Live
068.0
通义千问3.8-Max在视觉竞技场排名第二,仅落后Claude 13分
阿里巴巴的通义千问3.8-Max在视觉竞技场(Vision Arena)基准测试中以1305分排名第二,仅落后Claude Fable 5(High)13分。该模型还在其他领域表现强劲,在前端代码竞技场排名第四,在文本竞技场排名第二。这标志着通义千问系列在多模态能力上的重要里程碑。 这一成就表明,开源AI模型在复杂的视觉推理任务中能够与Claude等顶尖闭源模型紧密竞争。它标志着AI领域的一个转变:开放权重模型正在缩小性能差距,可能使先进的多模态AI更加普及。在多个竞技场的强劲表现表明,通义千问3.8-Max有望成为开发者和企业的多功能工具。 通义千问3.8-Max是一个拥有2.4万亿参数的混合专家(MoE)模型,上下文窗口达100万token,其开放权重计划于下周发布。在前端代码竞技场中,它获得1668分,仅次于Claude Opus 5(Max)和Kimi K3(Max),与Claude Opus 5(High)持平。视觉竞技场基准测试使用真实用户对话来评估开放式视觉推理,是衡量多模态理解能力的实用指标。
背景
视觉竞技场是一个基准测试,根据模型在开放式对话中理解和推理图像的能力进行排名,使用人类偏好数据。前端代码竞技场评估模型根据设计稿或描述生成前端代码的能力。通义千问3.8-Max是阿里巴巴通义千问系列最新、能力最强的模型,被设计为能够处理文本、图像等多种数据类型的基础多模态模型。
社区讨论
社区反应积极,许多人强调开源模型与闭源领先者如此接近竞争的重要性。一些用户对即将发布的开放权重表示兴奋,另一些人则指出该模型在多个领域的强劲表现是阿里巴巴AI能力增长的标志。
8月3日 06:32在 X 打开#AI #Qwen #Vision Arena #model ranking #open-source
078.0
SenseNova U1.5-Lite-Preview:开源8B多模态模型,支持4K图像生成
商汤科技开源了SenseNova U1.5-Lite-Preview,这是一个轻量级8B多模态模型,在图像生成和编辑方面较前代U1有显著提升。它原生支持4K图像生成,在大画幅输出中细节清晰可见,并提供精确的文字编辑功能,能保留原有字体和材质。该模型还支持通过画框指定编辑区域,框外内容不受影响。 该发布表明,一个8B的开源模型在图像生成和编辑方面可与商业闭源模型媲美,降低了开发者和研究人员的门槛。原生4K支持和先进的文字渲染能力使其适用于海报、杂志设计等专业应用。通过将理解与生成统一于单一模型,它推动了高效、一体化多模态AI的前沿发展。 该模型基于NEO-unify架构,采用新的patch编码/解码层,并使用混合专家(MoE)设计,在运行时仅激活选定的专家以提高效率。它在理解和生成基准测试中均达到开源模型中的最先进水平。模型已在GitHub、Hugging Face和魔搭社区上提供,权重和代码均可公开获取。
背景
SenseNova U1于2026年4月由商汤科技发布,是首个将图像理解、推理、生成和编辑融合在单一架构中的原生统一多模态模型。与早期拼接多个模型的方法不同,U1从第一性原理出发采用统一范式。U1.5-Lite-Preview是迭代升级版,优化了训练数据和模型效率,使其更适用于实际应用,同时保持开源。
8月3日 10:00在 X 打开#AI #Multimodal #Open Source #Image Generation #SenseNova
087.0
严格验收标准防止AI编程代理跑偏
AI实践者@dotey分享了在AI编程工具中使用/goal命令的实用技巧:在每个阶段定义严格的验收标准,例如通过截图进行像素级UI对比,以防止AI跑偏。他通过一个迁移任务演示了这一点:在没有标准时AI交付了差强人意的结果,但加入像素差异验证后,AI逐步修正UI直至与原版一致。 这一建议解决了AI辅助编程中的常见痛点:当任务模糊时,代理往往会偷工减料或偏离需求。通过强制执行具体、可衡量的验收标准(如像素级对比),开发者可以显著提高输出质量并减少手动返工,使AI编码工作流在生产中更加可靠。 /goal命令在Claude Code和Codex等工具中可用,允许代理持续运行直到满足条件。@dotey的方法是在每个阶段截图并与原版UI进行像素差异对比,确保AI在输出视觉上完全一致前不会停止。他还指出,Codex的现代上下文压缩减少了交接的需要,但严格的标准对于防止AI偷懒仍然至关重要。
背景
/goal命令是AI编程代理中的一项功能,允许它们自主朝着定义的目标工作,迭代直至完成。如果没有明确的验收标准,代理可能会产生不完整或错误的结果。像素级对比是前端开发中的一种技术,通过在像素级别比较UI元素来确保精确的视觉保真度。Claude Code和Codex是流行的AI编码工具;Fable 5是Anthropic最新的模型,为Claude Code提供动力,以处理复杂、长时间运行的任务而闻名。
8月3日 23:25在 X 打开#AI coding #prompt engineering #workflow #Claude Code #Codex
097.0
开发者分享使用 Fable 5 和 Codex 的高性价比多智能体工作流
一位开发者详细介绍了一个实用工作流:由 Fable 5 编写技术方案,Codex 负责执行,再由 Fable 5 进行验收。该方法通过文档传递上下文,并策略性地使用 /compact 命令来降低成本。工作流还对比了使用 Opus 5 作为替代方案,指出 GPT-5.6 Sol 在稳定性和 token 效率上更优。 该工作流展示了如何协调多个 AI 智能体来完成复杂软件任务,同时兼顾质量与成本。它为采用智能体编码工具的开发者提供了可操作的模式,有望提高生产力并降低 API 费用。模型之间的对比有助于从业者为每个角色选择合适的工具。 该工作流使用 Fable 5 生成技术方案文档,然后交给 Codex(GPT-5.6 Sol xhigh)执行。方案确认后,发送 /compact 命令压缩对话,利用提示缓存降低成本。对于复杂任务,可为 Codex 添加 /goal 以避免反复 continue。Fable 5 随后验证实施情况,任何反馈都会发回同一 Codex 会话进行完善。开发者发现 Opus 5 在稳定性和 token 持久性上不如 GPT-5.6 Sol。
背景
Fable 5 是 Anthropic 的 Claude 模型,专为自主、长时间运行的智能体任务设计,常用于规划和分析。Codex 是 OpenAI 的 AI 编码智能体,可通过 CLI、IDE 集成和 ChatGPT 使用,能够编写和调试代码。提示缓存是一种存储和重用提示前缀以降低 API 成本和延迟的功能,由 Anthropic 于 2024 年推出,其他平台也有提供。/compact 命令是一些 AI 编码环境中用于压缩对话历史的工具,可节省上下文窗口空间和成本。
8月3日 19:32在 X 打开#AI agents #workflow optimization #Codex #Fable 5 #software development
107.0
阿里巴巴通义千问宣布聚焦视觉智能体
阿里巴巴的通义千问团队宣布将聚焦于视觉智能体,标志着其战略转向开发能够感知并基于视觉信息采取行动的AI智能体。该消息通过其官方X(原推特)账号发布,但未披露具体技术细节或产品时间表。 此举顺应了将视觉与智能体能力相结合的行业趋势,模型不仅能理解图像,还能执行计算机操作或手机控制等任务。这可能加速面向企业自动化、机器人和消费级应用的更自主AI系统的开发,并对Kimi K2.5等视觉智能体领域的竞争对手构成挑战。 尽管公告缺乏细节,但通义千问现有的Qwen2.5-VL模型已支持动态工具使用和视觉定位等视觉智能体能力。新的聚焦可能基于此基础,并可能与Qwen-Agent框架集成。未提供发布日期、基准测试或定价信息。
背景
视觉智能体是指结合计算机视觉与智能体能力的AI系统,使其能够感知视觉环境并采取行动以实现目标。这一概念随着Kimi K2.5等支持原生多模态输入和智能体集群的模型而日益受到关注。通义千问是阿里巴巴的大语言和视觉语言模型系列,其中Qwen2.5-VL是其旗舰视觉模型,能够作为视觉智能体执行计算机操作等任务。
8月3日 02:15在 X 打开#AI #visual AI #agents #Alibaba
117.0
Qwen基础模型团队在Twitter举办AMA活动
Qwen基础模型团队通过其新账号@QwenDevs在Twitter上宣布举办'Ask Me Anything'(AMA)活动。这是他们首次在该平台上直接与社区互动,邀请开发者和研究人员提问。 此次AMA表明这个重要的开源LLM团队致力于透明度和社区驱动开发。它为与Qwen创建者直接对话提供了难得的机会,可能影响未来模型方向并增强信任。 该AMA通过Qwen官方推文宣布,引用了新的@QwenDevs账号。未提供具体日期或形式细节,但团队的消息暗示这是一场开放式问答。Qwen模型参数规模从0.6B到235B不等,涵盖语言、视觉、音频、代码、数学和推理等领域。
背景
Qwen是阿里巴巴开发的一系列开源基础模型,以在基准测试中的强劲表现而闻名。AMA代表'Ask Me Anything',是社交媒体上流行的形式,个人或团队公开回答问题。Qwen团队最近推出了Qwen 2.5以及Qwen2.5-Coder和Qwen2.5-Math等专用模型。
8月3日 03:20在 X 打开#Qwen #LLM #AMA #open-source #AI
127.0
MakePlay 推出免费 AI 游戏构建器,通过文本提示生成完整游戏
MakePlay 正式发布,这是一个免费的浏览器端 AI 游戏构建器,用户只需输入一句文本提示,平台即可自动生成完整的游戏,包括代码、美术、音乐、音效和关卡设计。该工具支持多种游戏类型,如第一人称射击、开放世界、竞速、解谜和平台跳跃,并允许用户通过自然语言指令进行迭代修改。 该产品的发布大幅降低了游戏开发的门槛,让任何有创意的人无需编程或美术技能即可制作可玩游戏。这标志着 AI 辅助创作的重要进步,有望使游戏设计大众化,并催生新一轮的用户生成内容。其免费、基于浏览器的特性消除了成本和硬件障碍,使全球用户都能轻松创作游戏。 MakePlay 完全在浏览器中运行,无需游戏引擎、素材或安装设置。它提供“分支开发”功能,允许用户在同一游戏中尝试不同的设计思路并对比实际体验。该平台目前免费,但长期定价或限制尚未公布。用户创建的“越跑越龙”(一款肉鸽跑酷游戏)被作为单句提示生成游戏的示例展示。
背景
传统游戏开发通常需要掌握编程语言、Unity 或 Unreal 等游戏引擎以及素材创作工具。像 MakePlay 这样的 AI 游戏构建器利用生成式 AI 自动化这些流程,通过解读自然语言提示来生成可玩游戏。这种方法属于无代码和 AI 驱动创作工具的大趋势,旨在让非专业人士也能完成复杂任务。类似的平台还有 Astrocade,同样能将文字描述转化为游戏。
社区讨论
社区反响积极,用户称赞该平台易于使用,能快速将游戏创意原型化。一些人对分支开发功能表示兴奋,认为便于对比设计选择。但目前尚未出现详细的技术讨论或批评性反馈。
8月3日 04:49在 X 打开#AI game development #no-code #generative AI #game builder #launch