- DeepSeek V4 Pro 发布,多项基准测试超越 Claude Opus 4.88.0
- Meta收购被中国监管否决,Manus将恢复独立运营8.0
- Qwen-Image-3.0 登陆 OpenArt,支持多语言文本渲染8.0
- 实测 H3 视频生成优化:8V8A 步数、CK 注意力、LoRA 与低显存方案7.0
- Qwen3.8-Max 在法律研究基准上从第22名跃升至第4名7.0
- OPC Skills:为独立开发者自动化任务的10个智能体技能7.0
- Dembrandt:几秒钟提取任意网站的设计系统7.0
- SadServers:动手实践 Linux 排障的在线平台7.0
- img2threejs:从单张照片生成可360度旋转查看的3D模型7.0
- Codex 活跃用户突破 1500 万,触发承诺的重置7.0
- LangSmith BYOC 现已在 AWS 上正式推出7.0
- AI产品优势转向应用层,模型商品化趋势凸显7.0
018.0
DeepSeek V4 Pro 发布,多项基准测试超越 Claude Opus 4.8
DeepSeek 宣布推出 DeepSeek V4 Pro,据称在多项基准测试中超越了 Anthropic 的 Claude Opus 4.8。该消息由 @dotey 在推特上发布,并附上了 DeepSeek 官方 API 文档的定价链接。推文中未详细说明具体基准测试结果,但 @OipsAnthony 的补充表明在多个领域实现了超越。 这一消息表明前沿 AI 模型领域的竞争正在加剧,尤其是在 Claude Opus 4.8 一直处于领先地位的编程和智能体任务方面。如果 DeepSeek V4 Pro 能够以更低的成本提供相当或更好的性能,它可能会颠覆市场并加速开放权重模型的采用。开发者和企业可能会从更实惠的高性能选项中受益。 根据第三方评测,DeepSeek V4 Pro 在 SWE-bench 上达到 80.6%,在 Terminal-Bench 上击败了 Claude,同时成本大约低 7 倍。它被描述为 2026 年最便宜的开放权重前沿编程模型。官方定价可在 DeepSeek 的 API 文档页面上找到。然而,推文本身并未提供具体的基准测试数字,而且由于基准测试行数不足,该模型在 BenchLM 上还没有公开的综合评分。
背景
DeepSeek 是一家中国 AI 公司,以发布具有竞争力的开放权重模型而闻名,例如 DeepSeek-V3 和 DeepSeek-R1,这些模型因其性能与成本之比而受到关注。Claude Opus 4.8 是 Anthropic 于 2026 年 5 月发布的最新高端模型,专注于编程、智能体任务和专业工作。SWE-bench 和 Terminal-Bench 等基准测试分别衡量模型解决现实世界软件工程问题和终端任务的能力。开放权重模型允许开发者自行下载和运行模型,与专有 API 相比,提供了更大的灵活性和潜在更低的成本。
社区讨论
@dotey 的推文引发了简短的交流,@OipsAnthony 补充了额外信息。由于提供的内容中没有详细的社区评论,因此无法评估整体情绪。
8月12日 15:44在 X 打开#AI #DeepSeek #model release #benchmarks
028.0
Meta收购被中国监管否决,Manus将恢复独立运营
8月11日,Manus宣布将恢复独立运营,此前Meta以20亿美元收购该公司的交易被中国监管机构否决。这笔于2025年12月宣布的交易在2026年4月被中国国家发改委下令撤销,两家公司此后开始剥离业务。 这是罕见的跨境科技收购因监管干预而被撤销的案例,凸显了AI领域地缘政治紧张局势的升级。这表明中国当局愿意审查并阻止涉及战略技术的交易,这可能会给未来该领域的跨境并购带来寒蝉效应。 在动荡期间,Manus的收入增长了约5倍,从每天30万美元增至近150万美元,其年度经常性收入超过3亿美元。该公司保持每周功能更新,并已准备好2.0版本,待交易完全解除后发布。尽管存在不确定性,其150名员工无一人离职,投资者现在渴望参与其下一轮融资。
背景
Manus是一家由肖弘创立的AI智能体初创公司,以其自主任务执行能力而闻名。2025年12月,Meta同意以超过20亿美元收购该公司,使其成为Meta最大的收购案之一。然而,中国监管机构以技术转让和国家安全为由启动审查,最终下令撤销该交易。
8月12日 07:03在 X 打开#Manus #Meta #acquisition #regulation #AI
038.0
Qwen-Image-3.0 登陆 OpenArt,支持多语言文本渲染
阿里巴巴通义千问宣布 Qwen-Image-3.0 现已在 OpenArt AI 平台上线。该模型支持 12 种语言的本地文本渲染、精确到 10 像素的字体,并能生成网页、游戏和直播等完整界面。此次发布标志着 AI 图像生成在融入现实世界知识方面取得了重大进展。 Qwen-Image-3.0 能够渲染准确的多语言文本和复杂的 UI 布局,解决了 AI 图像生成中长期存在的短板。这可能会对依赖自动化设计、本地化和内容创作的行业产生重大影响,使 AI 生成的视觉内容更适用于实际应用。与 OpenArt 的集成扩大了创作者和开发者的使用范围。 该模型支持高达 4.5K token 的提示词,并能一次性渲染完整的信息图、微小文字和 12 种语言的字体。它旨在重现网页、游戏和直播等熟悉数字环境的视觉语言。在 Runware 平台上,该模型每次运行定价为 0.035 美元(约 1 美元可运行 28 次)。OpenArt 提供一系列 AI 创作工具,包括图像、视频和音频生成,并支持角色一致性创建。
背景
通义千问(Qwen)是阿里巴巴推出的一系列大型语言和多模态模型,在各类 AI 任务中表现优异。OpenArt 是一个 AI 艺术平台,汇集了多种先进的图像和视频生成模型,使用户能够轻松创建和编辑内容。Qwen-Image-3.0 是 Qwen 图像生成系列的最新版本,专注于信息图和 UI 设计等实用视觉输出。该模型对多语言文本渲染的重视解决了 AI 图像生成中常见的文本乱码或错误问题。此次发布顺应了 AI 模型日益专业化、面向现实应用的趋势。
8月12日 03:37在 X 打开#image-generation #AI #Qwen #OpenArt #multilingual
047.0
实测 H3 视频生成优化:8V8A 步数、CK 注意力、LoRA 与低显存方案
一位中国实践者分享了 MiniMax H3 视频生成的实测设置,推荐将 8 个视频步数搭配 8 个音频步数(8V8A)作为正式出片的默认值。他们在 RTX 4090 48GB 上对 CK 注意力后端进行了基准测试,与 PyTorch 注意力相比,总耗时减少了 12.1%(从 272.70 秒降至 239.70 秒)。帖子还重点介绍了新进展:基于 176 段真实视频训练的 Realism People LoRA、fal 提供的 LoRA 训练器,以及使用 ClipProj 和 GGUF 量化的低显存方案。 这些优化降低了使用 MiniMax H3 进行高质量视频生成的门槛,使硬件有限的用户也能更容易地使用。CK 注意力约 12% 的加速对迭代工作流意义重大,而角色 LoRA 和低显存方案的出现拓展了模型的实际应用场景。这反映了开源生成模型社区驱动优化的更广泛趋势。 8V8A 设置基于单个提示词和种子,作者指出需要更多样本进行验证。T8 要求音频步数 ≥ 视频步数,20V8A 会直接报错。CK 注意力通过 ModelAttentionBackend 节点仅为 H3 启用,而非全局 --use-ck-attention 标志。旧版 ComfyUI-MiniMaxH3-Cache 与新版 ComfyUI 存在 time_shift_slope 兼容性问题。ClipProj 将文本编码器显存占用从约 15.7GB 降至约 4.5GB,H3 GGUF 提供 Q2–Q8 量化,可在 8–16GB 显存下进行预览。
背景
MiniMax H3 是一个开源的全模态模型,能够根据文本、图像、视频和音频输入生成带有原生立体声音频的视频。ComfyUI 是一个流行的基于节点的界面,用于运行此类模型,并支持多种注意力后端(PyTorch、SageAttention、CK)以提升性能。LoRA(低秩适应)是一种用相对较少的数据对模型进行微调以适应特定风格或角色的技术。量化(GGUF)和模型卸载是降低大模型内存需求的常用方法。
8月12日 14:28在 X 打开#H3 #video generation #AI #optimization #benchmark
057.0
Qwen3.8-Max 在法律研究基准上从第22名跃升至第4名
阿里巴巴的 Qwen3.8-Max 模型在法律研究基准(Legal Research Bench)上的表现大幅提升,在不到三个月的时间里从第22名跃升至第4名。该模型在该基准上的得分几乎翻倍,该基准通过三小时时限和五种工具来评估 AI 智能体在法律研究任务中的能力。 这一快速进步展示了大语言模型在专业领域(如法律研究)的飞速发展。这表明 Qwen 正在成为 AI 领域的有力竞争者,可能对法律科技应用以及 AI 在专业服务中的更广泛采用产生影响。 法律研究基准是一个评估框架,智能体有三小时的时间限制,并可使用五种工具完成任务。Qwen3.8-Max 是阿里巴巴 Qwen 3.8 系列的旗舰模型,是一个参数超过 1 万亿的多模态模型。从第22名到第4名的提升发生在不到三个月内,得分几乎翻倍。
背景
法律研究基准是一个旨在评估 AI 模型执行法律研究任务能力的基准,模拟法律专业人士的工作。Qwen 是阿里巴巴开发的大语言模型系列,Qwen3.8-Max 是其最新的旗舰模型。此类基准用于比较不同 AI 模型在特定领域的能力。
8月12日 03:36在 X 打开#AI #LLM #Benchmark #Qwen #Legal AI
067.0
OPC Skills:为独立开发者自动化任务的10个智能体技能
OPC Skills 是一个新的开源集合,包含10个专为独立开发者和一人公司设计的AI智能体技能。它能自动化重复性任务,如SEO优化、域名比价、Logo生成以及在Reddit和X上进行市场调研。这些技能兼容包括Claude Code、Cursor和Codex在内的16种主流智能体工具。 该工具解决了独立开发者必须处理营销和设计等非编码任务的主要痛点。通过将这些杂务委托给AI智能体,开发者可以专注于核心产品开发,可能加快上市时间并减少倦怠。其与16种智能体工具的广泛兼容性使其能够触达广大用户。 该集合包含10个技能,涵盖SEO、域名搜索、Logo生成以及从Reddit和X挖掘需求。它是开源的,可在GitHub上获取:github.com/ReScienceLab/opc-skills。这些技能设计用于与16种智能体工具配合使用,包括Claude Code、Cursor和Codex。未提供定价信息,表明其可免费使用。
背景
独立开发者通常独自工作或在非常小的团队中,需要同时兼顾编码、营销、设计和研究。AI智能体技能是可以添加到AI编码助手以执行特定任务的模块化能力。Claude Code、Cursor和Codex等工具是支持此类扩展的流行AI驱动开发环境。SEO(搜索引擎优化)可提高网站在搜索结果中的可见性,而域名搜索和Logo生成对于品牌建设至关重要。在Reddit和X等平台上的市场调研有助于识别用户需求和趋势。
8月13日 00:00在 X 打开#agent skills #indie developers #automation #SEO #GitHub
077.0
Dembrandt:几秒钟提取任意网站的设计系统
Dembrandt 是一个新的开源工具,只需一条命令,就能在几秒钟内从任意网站提取完整的设计系统,包括配色、字体、间距、阴影和标志。它可以生成品牌指南,并以标准格式导出设计令牌。该工具还支持作为 MCP 服务器运行,让 Claude Code 或 Codex 等 AI 代理直接读取目标网站的设计规范。 该工具大幅减少了前端开发者和设计师在参考或分析竞品设计系统时所需的手工劳动。通过自动化提取和通过 MCP 与 AI 代理集成,它简化了工作流程,使设计系统审计和令牌管理更加高效。它解决了网页开发和设计中的一个常见痛点,可能节省数小时的繁琐工作。 Dembrandt 已在 GitHub 上开源,可以通过类似 `dembrandt bmw.de` 的命令运行以提取设计令牌。它导出与设计工具兼容的标准格式,并包含跟踪令牌漂移和比较历史快照的功能。MCP 服务器支持使其能够与 Claude Code 和 Codex 等 AI 编码助手集成。该项目是开源的,最近发布,并配有官方网站 dembrandt.com。
背景
设计系统是可复用组件和指南的集合,用于确保产品视觉一致性。设计令牌是构成设计系统的原子值,如颜色、字体和间距。MCP(模型上下文协议)是一个开放标准,允许 AI 助手连接外部工具和数据源。前端开发者通常需要手动检查网站来复制设计选择,这既耗时又容易出错。
8月12日 13:30在 X 打开#design-tools #frontend #MCP #developer-tools #design-systems
087.0
SadServers:动手实践 Linux 排障的在线平台
SadServers 是一个提供真实 Linux 服务器进行动手排障练习的在线平台。每道题都会在浏览器中提供一个连接到真实服务器的终端,你需要诊断并修复描述的问题,成功后会自动验证。平台覆盖数据库、Web 服务器、Docker、Kubernetes 等常见运维场景,难度从入门到进阶。 该平台填补了 Linux 系统管理和 DevOps 领域理论与实践之间的鸿沟。通过提供真实场景,它帮助学习者和专业人士建立排障的肌肉记忆,这对于 on-call 和应急响应岗位至关重要。它在技术面试中的应用也表明招聘正在向更注重实操技能的评估方式转变。 SadServers 无需注册即可免费试用,每个场景都提供一个可通过 Web 终端访问的真实 Linux 服务器。该平台是开源的,代码托管在 GitHub 上。它还提供面向企业的技术评估解决方案,让公司能够评估候选人的 Linux 和 DevOps 实操能力。
背景
Linux 排障是系统管理员、DevOps 工程师和 SRE 的核心技能,但通常通过文档和模拟环境学习,缺乏真实世界的复杂性。SadServers 由 DevOps 从业者 Fernando 创建,旨在为 Linux 和 DevOps 技能提供类似 LeetCode 的体验。平台的场景模拟了常见的生产环境问题,如服务配置错误、数据库故障和容器问题,让用户可以在安全但真实的环境中进行练习。
8月12日 07:30在 X 打开#Linux #DevOps #Troubleshooting #Practice #SRE
097.0
img2threejs:从单张照片生成可360度旋转查看的3D模型
img2threejs 引入了一种新颖的3D模型生成方法,仅凭一张照片,通过纯代码重建物体,不依赖扫描或模型文件。生成的模型自带动画能力,可在浏览器中旋转和交互。整个流程内置质量检查,每一步生成都会与参考图对比,不达标则停止。 该工具降低了创建交互式3D内容的门槛,使没有专业3D建模技能的网页开发者和设计师也能轻松上手。通过生成基于代码的模型,它便于编辑、动画制作和集成到Web应用中,有望加速3D在电商、教育和游戏等领域的应用。质量把关的方法解决了AI生成3D中常见的输出质量不一致问题。 该项目是开源的,代码托管在GitHub上。官方展厅包含枪械、自行车、耳机等十几个案例,均可在浏览器中体验。重建过程具有令牌效率,相比传统方法消耗更少的计算资源。该工作流专为编码代理设计,每一步都有明确的审查和限制。
背景
传统的3D模型创建通常需要在Blender等软件中手工建模或进行3D扫描,这需要专业知识和时间。近年来,基于AI的方法(如Meshy和GET3D)可以从图像或文本生成3D模型,但往往产生难以编辑或动画化的网格文件。img2threejs 则使用 Three.js(一种流行的浏览器3D图形JavaScript库)生成程序化代码,从而创建动态且可编辑的模型。质量把关的工作流确保重建的每一步都达到一定标准后才继续,提高了可靠性。
8月12日 04:00在 X 打开#3D modeling #computer vision #web development #GitHub #AI
107.0
Codex 活跃用户突破 1500 万,触发承诺的重置
Codex 活跃用户已突破 1500 万,这一里程碑触发了面向所有用户的承诺重置事件。Codex 负责人 Thibault Sottiaux 宣布了这一重置,他此前曾承诺每新增一百万用户就重置一次使用限额,直至 1000 万,现在已将此承诺延伸至 1500 万。重置预计在公告发布后一小时内生效。 这一里程碑展示了 OpenAI 的 AI 编码工具 Codex 的快速普及,而重置事件则是一种用户留存和参与策略。它凸显了 AI 编码助手领域的竞争格局,其中使用限额和重置是提升用户满意度的关键手段。活跃用户在短时间内从 1000 万增长到 1500 万,凸显了 Codex 在开发者社区中日益增长的重要性。 此次重置事件是对所有 Codex 订阅者每周使用限额的全局重置,此前在 300 万和 700 万用户时也进行过类似操作。在 700 万用户时,还增加了“存储重置”功能,允许用户通过桌面端或网页端在方便时应用重置。当前重置宣布将在一小时内生效,并鼓励用户“快速行动”以充分利用。推文中未提供关于重置机制或持续时间的更多技术细节。
背景
Codex 是 OpenAI 的 AI 编程助手,集成于 ChatGPT 等工具中,也有独立的命令行界面。它采用每周使用限额系统来管理计算资源。Thibault Sottiaux(人称“Tibo”)是 OpenAI 的 Codex 负责人,一直公开宣布里程碑和重置事件。在用户里程碑时重置限额的做法很早就已确立,并承诺每新增一百万用户就重置一次,直至 1000 万,后来由于增长超出预期而延长了该承诺。
8月13日 01:01在 X 打开#Codex #AI #milestone #community
117.0
LangSmith BYOC 现已在 AWS 上正式推出
LangChain 宣布 LangSmith 现已在 AWS 上以自带云(BYOC)部署方式正式推出。这使团队能够将代理追踪和运行时数据保留在自己的 AWS 边界内,同时由 LangChain 管理配置、升级、扩展和支持。BYOC 选项在提供数据主权的同时,兼具托管服务的速度。 这一进展对于有严格数据驻留或合规要求的企业意义重大,因为它们可以在不将敏感数据发送到自身云环境之外的情况下使用 LangSmith 的可观测性功能。它弥合了完全托管 SaaS 与自托管解决方案之间的差距,可能加速受监管行业对 LLM 可观测性的采用。 BYOC 部署在 AWS 上可用,并且已正式发布,意味着它已具备生产就绪能力。LangChain 负责运营方面的工作,包括配置、升级、扩展和支持,而客户保留对其数据的控制权。此选项不同于 LangSmith 的完全托管云和自托管产品,为有合规需求的团队提供了一个折中方案。
背景
LangSmith 是一个面向 LLM 应用的可观测性和评估平台,提供追踪、监控和调试功能。自带云(BYOC)是一种部署模式,软件在客户的云账户中运行,但由供应商管理。这与完全托管的 SaaS(供应商托管一切)和自托管(客户管理一切)形成对比。AWS(亚马逊云科技)是领先的云服务提供商,许多企业围绕它建立了现有的安全和合规框架。
8月12日 17:29在 X 打开#LangSmith #AWS #BYOC #LLM #Observability
127.0
AI产品优势转向应用层,模型商品化趋势凸显
一位知名AI评论员指出,未来几年AI产品最大的机会在应用层,而非模型开发。模型将变得更便宜、更优秀、更易于本地部署,从而降低其差异化。真正的优势将来自于深入理解用户工作流程并围绕其重新设计体验。 这一观点凸显了AI构建者的战略转变:随着基础模型商品化,价值将转移到解决特定用户问题的应用上。这表明产品意识和流程专业知识将比单纯的模型访问更重要,影响初创公司和开发者如何分配资源。这一趋势可能使AI产品创作民主化,同时提高差异化的门槛。 该评论指出,能够构建AI产品的人群即将变得庞大,因此成为前0.1%的构建者至关重要。这意味着模型商品化正在加速,行业研究显示开源模型仅落后于最先进的专有模型3-6个月。重点在于“重新设计体验的想象力”,而不仅仅是技术实现。
背景
在AI领域,“应用层”指的是利用底层AI模型为最终用户执行特定任务的软件产品,与模型本身相对。商品化发生在模型变得可互换且价格竞争激烈时,价值转移到应用和基础设施上。这类似于过去的技术周期,平台变得廉价,创新向上层移动。
8月12日 14:56在 X 打开#AI products #application layer #product strategy #AI trends #builders