- 月之暗面开源Kimi K3:2.8万亿参数MoE模型,支持百万token上下文9.0
- Kimi K3 推出“无晶圆厂”式 AI 模型,推理服务商需单独商业授权8.0
- Anthropic 阐明其对开放权重 AI 模型的立场8.0
- GPT-Live语音模型现已面向教育、商业和企业计划开放8.0
- VODER:一站式本地音频工具,集成语音克隆、TTS等八种模式8.0
- Kimi 发布 PerceptionBench,隔离原子级视觉感知能力8.0
- Kimi 开源 MoonEP,提升 MoE 专家并行通信效率8.0
- Kimi 开源 AgentENV,支持大规模智能体强化学习训练8.0
- 月之暗面开源高性能Kimi Delta Attention内核FlashKDA8.0
- 团队自建JIRA替代品,数月后因维护成本放弃7.0
- 中国开源AI模型霸榜Hugging Face趋势榜,引发全球主导地位讨论7.0
- 面向开发者的公开实时数据集精选列表7.0
019.0
月之暗面开源Kimi K3:2.8万亿参数MoE模型,支持百万token上下文
月之暗面(Moonshot AI)发布了Kimi K3的模型权重和技术报告,这是一个拥有2.8万亿参数的混合专家(MoE)模型。它具备原生视觉理解能力、100万token的上下文窗口,并采用了全新架构,使单位计算智能提升2.5倍。同时开源的还有高性能注意力内核、MoE通信库以及用于大规模智能体环境的基础设施。 Kimi K3是首个达到前沿性能水平的开源权重模型,可与顶尖闭源模型相媲美。它的发布使大规模AI的获取更加民主化,让研究人员和开发者能够部署和微调最先进的模型,用于复杂的智能体任务。随附的基础设施组件进一步降低了构建高级AI应用的门槛。 该模型采用Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)技术,以改善长序列和深层网络中的信息流动。它在Artificial Analysis智能指数上获得57分,仅比GPT-5.6 Sol(max)低2分。Kimi K3在发布首日即通过Fireworks、Together AI和Nebius等合作伙伴上线,提供微调和零数据保留选项。它在Agent Arena的开源权重模型中排名第一,净改进率达+9.75%。
背景
混合专家(MoE)是一种模型架构,将神经网络划分为多个专门的子模型(专家),每次仅激活部分专家处理输入,从而提高效率。100万token的上下文窗口使模型能够一次性处理极长的文档或对话,减少了对检索增强生成(RAG)的需求。开源权重模型公开训练参数,允许用户在不依赖专有API的情况下进行定制和研究。
7月27日 15:48在 X 打开#AI #open-source #MoE #large language model #Kimi K3
028.0
Kimi K3 推出“无晶圆厂”式 AI 模型,推理服务商需单独商业授权
月之暗面(Moonshot AI)发布了 Kimi K3 模型权重,采用自定义许可证,要求年经常性收入(ARR)超过 2000 万美元的推理服务商签署单独的商业协议。这是 AI 行业的一种新做法,将模型训练与推理服务分离,类似于半导体行业的无晶圆厂模式。此举被行业观察者预见,可能标志着开放权重模型许可方式的转变。 这种许可模式可能开创 AI 的“无晶圆厂”商业模式,让模型创建者专注于训练,推理服务商负责部署,从而催生专业化生态系统。它可能促使围绕微调、仅预填充适配等服务的新公司涌现,形成闭源厂商无法匹敌的竞争格局。这一做法可能重塑 AI 部署的经济模式,并影响开放权重模型的商业化方式。 Kimi K3 许可证是一份定制协议,而非 MIT 等标准开源许可证。它包含一条由收入触发的条款,专门针对模型即服务运营商,要求其年经常性收入超过 2000 万美元时须协商商业条款。除此之外,许可证允许免费使用、修改和分发模型权重及相关软件,用于研究和部署。这种结构使月之暗面能够从大规模商业推理中获利,同时保持模型对小型参与者和研究人员的可及性。
背景
无晶圆厂商业模式在半导体行业很常见,将芯片设计与制造分离;像 NVIDIA 这样的公司设计芯片,但将制造外包给台积电等代工厂。在 AI 领域,“开放权重”模型公开发布训练好的参数,但通常采用允许无限制商业使用的宽松许可证。推理服务商提供 API 来运行这些模型,通常按使用量收费。月之暗面的 Kimi K3 许可证为推理服务商引入了收入门槛,通过将模型训练和推理视为不同的业务层,效仿了无晶圆厂模式。
7月27日 17:15在 X 打开#open-weight models #AI licensing #business model #Kimi K3 #AI ecosystem
038.0
Anthropic 阐明其对开放权重 AI 模型的立场
Anthropic 发布了一篇博客文章,详细阐述了其对开放权重 AI 模型的官方立场,回应了近期的猜测。该公司表示,不具备危险能力的开放权重模型是一种公共产品,但主张对前沿模型进行监管。这标志着领先 AI 实验室的一项明确政策声明。 这一声明意义重大,因为它来自一家主要的 AI 开发商,并直接影响着关于开源与专有 AI 的持续辩论。Anthropic 的立场可能影响未来的法规和行业规范,从而影响依赖开放权重模型的开发者、企业和研究人员。它还凸显了 AI 生态系统中创新与安全之间的紧张关系。 Anthropic 区分了安全的开放权重模型和具有潜在危险能力的模型,主张仅对后者进行限制。根据外部分析,该博客文章可能提到了具体的政策要求,例如监管前沿模型的发布和工业蒸馏。该公司此前因未签署一份捍卫开放权重模型的公开信而受到批评,因此这一澄清是对行业压力的直接回应。
背景
开放权重 AI 模型是指其训练参数公开发布的机器学习模型,允许任何人在自己的硬件上使用、修改和运行它们。这与仅提供 API 或接口的专有模型形成对比。围绕开放权重模型的辩论集中在平衡透明度和创新的好处与滥用的风险上,例如生成有害内容或助长恶意行为者。以 Claude AI 助手闻名的 Anthropic 历来强调安全性,并对其最强大模型的开源持谨慎态度。该公司的立场是涉及 OpenAI、Meta 和 Mistral 等其他实验室的更广泛行业对话的一部分。
7月27日 22:52在 X 打开#AI #open-weights #Anthropic #policy
048.0
GPT-Live语音模型现已面向教育、商业和企业计划开放
OpenAI已将其新一代语音模型GPT-Live的可用范围扩展至全球的ChatGPT教育版、商业版和企业版计划。此前该功能仅限于个人订阅用户,此次推广使组织用户也能享受更自然、实时的语音对话。该消息于2025年3月20日通过OpenAI官方X账号发布。 此次扩展是将先进语音AI引入专业和教育环境的重要一步,可能改变团队协作、学习和与AI互动的方式。通过实现自然、类人的对话,GPT-Live可以提升各行业的生产力、可访问性和用户参与度。这也加剧了企业语音AI市场的竞争,对谷歌和亚马逊等竞争对手构成挑战。 GPT-Live包含两个模型:GPT-Live-1是付费个人计划的默认模型,还有一个较小的变体供免费用户使用。这些模型专为低延迟、实时交互而设计,支持打断和情感语调等功能。但可用性可能因地区而异,企业管理员可以控制访问权限。费用已包含在现有计划中,未宣布额外收费。
背景
GPT-Live是OpenAI三周前发布的最新语音模型,为ChatGPT语音功能提供支持,实现更自然的对话。ChatGPT语音功能本身于2023年9月推出,允许语音交互。新模型通过降低延迟和实现更动态、类人的交流,改进了早期版本。它与谷歌助手和亚马逊Alexa等其他语音助手竞争,但侧重于对话式AI而非简单指令。
7月27日 17:32在 X 打开#OpenAI #GPT-Live #Voice AI #ChatGPT #Enterprise
058.0
VODER:一站式本地音频工具,集成语音克隆、TTS等八种模式
VODER 是一个新的开源工具,将文字转语音、语音克隆、音效、背景音乐生成、人声分离和翻译等多种音频处理任务整合到一个本地界面中。它提供八种处理模式,完全离线运行,无需订阅,底层使用了 Whisper、Qwen3-TTS、Seed-VC 和 ACE-Step 等模型。 内容创作者通常需要在不同工具之间切换来处理音频任务,既耗时又需要技术经验。VODER 通过提供一站式、保护隐私的本地解决方案简化了工作流程,降低了为视频、播客和多语言内容制作专业音频的门槛。 VODER 支持通过短参考音频进行语音克隆,自动生成与语音时长同步的背景音乐(最多可拆出12条乐器轨),以及视频配音功能,可在翻译语音的同时保留原说话人的音色并生成字幕。它基于开源模型构建:Whisper 用于转录,Qwen3-TTS 用于文字转语音,Seed-VC 用于零样本语音转换,ACE-Step 用于音乐生成。
背景
文字转语音(TTS)将书面文本转换为语音,而语音克隆则从样本中复制特定人的声音。语音转换在不改变语言内容的情况下将一种声音变为另一种。Seed-VC 是一种零样本语音转换模型,仅需1到30秒的参考音频即可克隆声音。ACE-Step 是一个音乐生成基础模型,可根据文本提示生成长度可变的立体声音频。
7月28日 04:34在 X 打开#audio processing #open source #TTS #voice cloning #content creation
068.0
Kimi 发布 PerceptionBench,隔离原子级视觉感知能力
月之暗面(Kimi)发布了 PerceptionBench,这是一个新的基准测试,它从分析前沿模型在 42 个现有基准测试中的失败案例中提炼出 10 种原子级视觉感知能力。该基准包含 3000 个经过验证的问题,每个问题旨在测试单一的感知技能,无需推理或外部知识。数据集和代码已在 GitHub 和 Hugging Face 上开源。 该基准通过将纯粹的视觉感知与推理分离,解决了多模态模型评估中的一个关键空白,而现有基准往往将两者混为一谈。通过精确定位具体的感知弱点,它可以指导视觉语言模型进行有针对性的改进,从而构建更可靠的 AI 系统。开源发布鼓励社区在视觉理解方面取得进展。 10 种原子感知类别包括视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。Kimi 自家的 K3 模型目前以 58.5% 的得分领先该基准,表明仍有很大的改进空间。这些问题被设计为仅通过观察图像即可回答,无需思维链或外部知识。
背景
像 GPT-4V 和 Kimi 这样的多模态大语言模型结合了视觉和语言理解,但将视觉感知与推理分开评估具有挑战性。传统基准通常测试混合了感知与高级认知的复杂任务,难以诊断模型失败的原因。原子级视觉感知指的是人类认为简单、不可再分的基本视觉技能,例如计数物体或识别颜色。通过隔离这些技能,研究人员可以更好地理解模型的局限性并改进架构。
7月27日 18:45在 X 打开#benchmark #visual perception #AI evaluation #open source #machine learning
078.0
Kimi 开源 MoonEP,提升 MoE 专家并行通信效率
Kimi(月之暗面)开源了 MoonEP,一个专为分布式混合专家(MoE)工作负载设计的高性能通信库。MoonEP 优化了专家并行通信,这是大规模 MoE 训练和推理中的关键瓶颈。该库现已在 GitHub 上的 MoonshotAI 组织下公开。 专家并行通信涉及频繁的全交换数据,是扩展 MoE 模型的主要性能瓶颈。通过减少通信开销,MoonEP 可以加速大语言模型的训练和推理,可能降低成本并提高硬件利用效率。这一贡献惠及整个机器学习社区,尤其是从事分布式 MoE 系统的团队。 MoonEP 旨在提高大规模专家并行通信的效率,针对 MoE 分发和合并操作中典型的细粒度 token 级传输。虽然公告中未提供具体的基准测试或实现细节,但该库可能针对 GPU 发起的通信模式进行了优化。代码可在 http://github.com/MoonshotAI/MoonEP 获取。
背景
混合专家(MoE)是一种神经网络架构,每个输入仅激活一部分“专家”子模型,使模型能够扩展到数万亿参数而无需成比例增加计算量。在分布式 MoE 系统中,专家分布在多个 GPU 上,token 必须通过全交换通信路由到正确的专家,这可能成为瓶颈。像 MoonEP 这样的专家并行通信库旨在优化这种数据交换,减少延迟并提高吞吐量。
7月27日 15:26在 X 打开#open-source #distributed computing #MoE #machine learning #communication library
088.0
Kimi 开源 AgentENV,支持大规模智能体强化学习训练
Moonshot AI 的 Kimi 团队与 kvcache-ai 合作,开源了分布式平台 AgentENV,用于大规模运行智能体环境。AgentENV 为 Kimi K3(一个 2.8 万亿参数模型)的智能体强化学习训练提供支持。该系统支持大规模并行智能体工作流的快速快照、恢复和分叉功能。 此次发布为 AI 社区提供了用于智能体强化学习的生产级基础设施,这是训练高级 AI 智能体的关键组成部分。通过开源训练 Kimi K3 的系统,Moonshot AI 使研究人员和开发者能够复现并基于其工作进一步开发,有望加速智能体 AI 的进展。其可扩展设计解决了 RL 训练中的关键瓶颈,使大规模实验更加容易实现。 AgentENV 是一个专为智能体环境设计的分布式平台,具备快照、恢复和分叉支持,以处理大规模并行工作流。它被用于训练 Kimi K3,一个采用 Kimi Delta Attention 和 Attention Residuals 的 2.8T 参数模型。代码已在 GitHub 上的 kvcache-ai 组织下开源,文档详细说明了其架构和使用方法。
背景
智能体强化学习(RL)涉及训练 AI 智能体在环境中采取行动以最大化奖励,通常需要大规模并行模拟。像 AgentENV 这样的分布式系统可以跨多台机器管理这些模拟,实现高效扩展。Kimi K3 是 Moonshot AI 开发的大型语言模型,以其长上下文和先进的推理能力而闻名。开源基础设施工具是 AI 领域日益增长的趋势,有助于促进协作和可复现性。
7月27日 15:25在 X 打开#open-source #agent-environments #distributed-systems #reinforcement-learning #AI
098.0
月之暗面开源高性能Kimi Delta Attention内核FlashKDA
月之暗面开源了FlashKDA,这是一个基于CUTLASS的Kimi Delta Attention内核实现。在H20 GPU上,相比flash-linear-attention基线,它实现了1.72倍到2.22倍的预填充加速。FlashKDA可作为flash-linear-attention的直接替换后端使用。 该版本为长上下文Transformer模型带来了显著的性能提升,这对处理大型文档和多模态数据至关重要。通过提供直接替换的后端,它降低了研究人员和工程师采用高效注意力机制的门槛。加速直接转化为更低的推理成本和延迟,惠及聊天机器人和代码助手等应用。 FlashKDA基于NVIDIA的高性能GPU内核模板库CUTLASS构建,确保了优化的执行效率。报告的加速效果是在数据中心级GPU H20上测得的,表明其已为生产环境做好准备。它专门加速预填充阶段,这通常是长上下文场景中的瓶颈。该实现已在GitHub上的MoonshotAI组织下开源。
背景
Kimi Delta Attention (KDA) 是一种专为超长上下文设计的线性注意力机制,通过更细粒度的门控扩展了Gated DeltaNet。CUTLASS 是一组用于高效矩阵乘法和其他操作的CUDA C++模板。flash-linear-attention 是一个提供线性注意力高效实现的库,FlashKDA 作为其更快的后端。Transformer中的预填充阶段处理输入提示,计算密集,尤其是在长序列时。
7月27日 15:25在 X 打开#open-source #attention-kernels #performance #CUTLASS #AI-infrastructure
107.0
团队自建JIRA替代品,数月后因维护成本放弃
今年3月,一个团队开发了自己的JIRA替代品,完全抛弃了购买的SaaS项目管理软件。这个定制方案甚至由一位QA主管开发,起初功能丰富且好用。但到了7月,他们重新用回Linear,因为维护内部工具占用了太多实际工作精力。 这个故事揭示了软件开发中一个常见陷阱:开发工具容易,但不代表值得长期维护。它为考虑用定制内部工具替代成熟SaaS产品的团队敲响警钟,强调维护成本可能超过初期开发速度。在AI辅助“氛围编程”时代,这一教训尤为重要,因为第一版容易,但可持续性很难。 该团队最初构建了一个定制项目管理工具(可能受JIRA启发),并认为功能更优。开发者是QA主管而非全职工程师,凸显现代开发工具的易用性。四个月后,他们重新使用Linear——一款以速度和简洁著称的流行项目管理SaaS。核心洞察是:“氛围编程”(AI辅助快速开发)让初始创建变得简单,但维护仍是沉重负担。
背景
JIRA是Atlassian公司广泛使用的项目管理工具,尤其在软件开发领域,但可能复杂且昂贵。Linear是较新的精简替代品,专注于速度和开发者体验。“氛围编程”是2025年由Andrej Karpathy创造的术语,指AI辅助编码,开发者向大语言模型描述任务并接受生成的代码,几乎不做审查,能快速原型但往往牺牲可维护性。
7月28日 07:07在 X 打开#software engineering #internal tools #SaaS vs build #maintenance cost #vibe coding
117.0
中国开源AI模型霸榜Hugging Face趋势榜,引发全球主导地位讨论
中国开源AI模型Kimi K3和百度Unlimited OCR占据了Hugging Face全球模型趋势榜的前两名。Kimi K3是一个拥有2.8万亿参数的混合专家模型,上下文窗口达到百万token级别;Unlimited OCR则采用新颖的R-SWA架构,实现高效长文档处理。这标志着开源模型首次在这类权威榜单上超越闭源模型。 这一进展标志着全球AI格局的转变,目前只有美国和中国在模型训练的前沿展开竞争。它凸显了中国开源生态系统的日益强大,并引发了关于其他国家为何不开发自己大规模模型的疑问。这些模型的成功可能会加速开源技术的采用,并挑战闭源AI系统的主导地位。 Kimi K3每个token激活896个专家中的16个,并采用Kimi Delta Attention和Attention Residuals实现高效长上下文处理。Unlimited OCR采用基于参考的滑动窗口注意力(R-SWA)和恒定KV缓存,能够处理32K token的OCR任务,且跨页表格识别和阅读顺序不易中断。两款模型都获得了Elon Musk和Yann LeCun等知名人士的关注。
背景
Hugging Face是分享和发现机器学习模型的核心平台,其趋势榜反映了社区兴趣。混合专家(MoE)是一种神经网络架构,每次输入只激活部分参数,从而在可控计算成本下实现更大模型。OCR(光学字符识别)将文本图像转换为机器可读文本,长文档OCR因内存和连贯性问题仍具挑战性。R-SWA架构通过维持恒定大小的缓存并参考近期上下文来解决这一问题。
社区讨论
社区普遍认可这些中国模型的技术实力,部分人对其他国家缺乏类似努力表示惊讶。讨论强调了可能阻碍其他国家投资大规模AI训练的战略和经济因素,如计算成本和数据可用性。一些用户还指出了美中在AI领域双头垄断的地缘政治影响。
7月28日 14:07在 X 打开#AI #open-source #China #global AI landscape #Hugging Face
127.0
面向开发者的公开实时数据集精选列表
一个名为“awesome-public-real-time-datasets”的新GitHub仓库发布,精选了大量公开的实时数据源。涵盖金融、交通、健康、物联网、安全和体育等领域,许多数据集可通过直接API或流式传输访问。该列表明确标注了免费和付费数据集,许多免费选项甚至无需注册或API密钥。 该集合降低了开发者和数据工程师获取实时数据流进行原型设计、学习和构建实时应用的门槛。它解决了寻找可靠、最新的公共数据源这一常见难题,可加速算法交易、交通应用和物联网监控等领域的创新。通过汇总免费和付费选项,它为需要持续数据摄取的项目提供了一个实用的起点。 该仓库托管在GitHub上的Bytewax组织下,该组织还开发了一个开源的Python流处理框架。包含的数据集示例有实时加密货币价格、新区块链交易通知和美国证券交易委员会文件。该列表由社区驱动并接受贡献,数据集按领域分类,并清晰标注了费用和访问要求。
背景
实时数据流对于需要即时更新的应用至关重要,例如股票行情、实时交通地图和安全警报。公共数据集通常分散在各种门户和API中,导致发现困难。“awesome”列表格式是GitHub上围绕特定主题整理资源的一种流行方式,而Bytewax是一家提供流数据处理工具的公司,这与该数据集集合的目标一致。
7月28日 13:30在 X 打开#datasets #real-time #data engineering #open data #GitHub