- 为何多模态(尤其是视觉)对AI在人择世界中至关重要8.0
- Opus 5 从文本提示生成指环王的 5500 行 Three.js 渲染8.0
- 阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,主打编程与协作8.0
- 10个爆款Codex工作流:3D游戏、视频自动化与变现7.0
- Karpathy 分享可玩的浏览器版“鹈鹕骑自行车”LLM 测试7.0
- RSTGameTranslation:实时AI游戏翻译工具7.0
- 本地大模型资源精选 GitHub 清单7.0
- 社区热议 Opus 4.6 与 Opus 5 的写作风格和个性差异6.0
- ClaudeBar:macOS 菜单栏工具实时监控 AI 编程助手用量6.0
- AuthPass:免费开源跨平台密码管理器,兼容 KeePass 格式6.0
- Bettercap:获19000多颗GitHub星的开源网络安全工具6.0
- AI在数学中的应用或如国际象棋般增加对数学家的需求6.0
018.0
为何多模态(尤其是视觉)对AI在人择世界中至关重要
@xleaps 发布的一条推文(由 @dotey 转发)澄清了AI中多模态的含义,认为视觉输入对于将模型锚定在以人为中心的环境中是不可替代的。它还透露,DeepSeek 与 Anthropic 一样,在其公开API中避免多模态输出,但内部处理视觉信号,并且企业已经在为 DeepSeek 模型嫁接视觉编码器。 这一解释通过“人择原理”戳破了多模态的炒作——红绿灯和图形界面等人类设计的系统本质上是视觉的,因此AI必须处理视觉才能有效运作。它还澄清了DeepSeek专注于纯文本输出的战略选择,这与更广泛的行业观点一致,即多模态生成是一个可与核心AGI研究分离的工程问题。 该推文强调视觉信号对于 grounding 至关重要——理解“红灯”在驾驶场景中的实际含义,而不仅仅是语义。它指出 DeepSeek 的非API、非开放权重版本可以处理视觉输入,许多企业应用正在为 DeepSeek 添加 ViT(视觉Transformer)。作者认为,长程任务和持续学习最终不可避免地需要多模态输入,尤其是视觉,以将人择的数字世界 token 化。
背景
多模态AI指能够处理并整合文本、图像、音频等多种数据类型的模型。这里的“人择原理”是指人类设计的环境(如交通系统、计算机界面)是围绕人类感官模态(主要是视觉)构建的。Grounding 是指将抽象符号或 token 与现实世界指代物连接起来的挑战,确保AI以符合人类感知的方式理解概念。DeepSeek 是一家以大型语言模型闻名的中国AI公司,Anthropic 是一家同样专注于文本模型的美国AI安全公司。
社区讨论
该推文回应了一条声称多模态对AGI不重要的引用推文,将其比作盲人的智力。社区争论的焦点在于视觉仅仅是一种“能力”还是智力的基础;作者认为,虽然盲人具有智力,但他们无法驾驶汽车或使用视觉界面,因此AI需要视觉来执行现实世界任务。
8月2日 15:30在 X 打开#multimodal AI #DeepSeek #AGI #grounding #AI research
028.0
Opus 5 从文本提示生成指环王的 5500 行 Three.js 渲染
Andrej Karpathy 展示了 Opus 5 从文本提示生成指环王第一段的 5500 行 Three.js 程序化渲染。该 LLM 用了约 2 小时和 100 万 token 预算(约 10 美元)生成了自定义 3D 场景。这标志着从简单的 SVG 测试转向复杂、长周期的创意编码任务。 这展示了 LLM 处理对人类来说过于繁琐或定制化任务的能力,开启了按需生成“超定制世界”的可能。它预示着 AI 可以廉价地生成交互式、故事驱动的 3D 体验,可能改变游戏开发和创意媒体。该示例还突显了 LLM 在长周期项目中的耐力,使以前不切实际的想法变得可行。 Opus 5 编写了 5500 行代码,在三维坐标中程序化放置和动画化多边形资源。该过程耗时约 2 小时,API 使用成本约 10 美元。结果被描述为“粗糙但有趣”,LLM 因多模态感知能力有限而难以审核其工作,必须通过截图来检查进度。
背景
Three.js 是一个流行的 JavaScript 库,用于在浏览器中创建 3D 图形。程序化生成使用算法自动创建内容,常用于游戏中的地形或纹理。像 Opus 5 这样的 LLM 是能够从自然语言提示生成代码的大型语言模型。Karpathy 的测试超越了简单的图像生成,转向复杂的交互式 3D 场景,展示了 AI 不断增长的创意编码能力。
8月2日 05:14在 X 打开#LLM #3D rendering #AI creativity #procedural generation #Opus 5
038.0
阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,主打编程与协作
阿里巴巴发布了Qwen3.8-Max预览版,这是其新的旗舰AI模型,拥有2.4万亿参数。该模型采用稀疏混合专家架构,支持文本、图像、视频和文档等多模态输入,上下文窗口达100万token。官方称其在编程和协作方面树立了新标杆,但尚未公布详细基准测试和许可证信息。 此次发布表明阿里巴巴持续发力,与全球领先AI模型竞争,尤其是在编程和智能体任务方面。一个拥有2.4万亿参数、100万上下文窗口的多模态模型,有望在软件开发和协作AI中实现更复杂、长周期的应用。承诺开放权重也可能加速社区创新和采用。 Qwen3.8-Max是一个稀疏混合专家模型,总参数量2.4万亿,但每个token激活的参数量未公开。它支持文本、图像、视频和文档等多模态输入,上下文窗口为100万token。目前该模型以预览版形式通过API提供,并计划很快开放权重。尚未公布具体的基准测试、定价或许可证细节。
背景
Qwen是阿里巴巴的大型语言及多模态模型系列,此前Qwen3-Max等版本已在编程和推理方面展现出强大性能。混合专家(MoE)架构每次推理仅使用部分参数,提高了效率。该模型顺应了增大上下文窗口和多模态能力以处理多样化现实任务的趋势。阿里巴巴此前已开放部分Qwen模型的权重,培育了开发者与研究社区。
8月3日 01:46在 X 打开#AI #LLM #Qwen #coding #model release
047.0
10个爆款Codex工作流:3D游戏、视频自动化与变现
X平台上一篇精选推文整理了10个爆款案例,展示个人如何利用OpenAI的Codex构建3D网页游戏、自动化日更视频和剪辑,甚至实现月入超10万元人民币。合集涵盖了集成img2threejs、Remotion和HyperFrames等工具的工作流,呈现了实用的AI驱动内容流水线。 这份合集标志着AI应用从单纯提高效率转向构建能产生实际收入的内容、产品和服务流水线。它降低了非技术创作者的门槛,表明只要有明确想法并持续迭代,个人就能将AI转化为可持续业务。这一趋势反映了创意产业中AI民主化的更广泛动向。 该推文链接了具体工作流:用Opus 5和Codex制作的3D网页游戏、开源Codex组合技工具包,以及让Codex拥有“无限子弹”的技能。其他亮点包括Codex结合Remotion实现日更视频涨粉过万、开源抖音工作流赚取5万多元,以及结合Codex、HyperFrames、HeyGen和声音克隆的变现流水线。还包含将工作流沉淀为GitHub上Codex Skill的教程。
背景
OpenAI的Codex是一个AI编程代理,可辅助编写代码、修复错误和自动化软件任务。它能集成到各种工作流中,常与其他工具搭配使用。img2threejs可将参考图像转换为程序化Three.js 3D模型。Remotion是一个基于React的编程视频创作框架。HyperFrames是视频编辑工具,HeyGen提供AI驱动的数字人和声音克隆。这些工具与Codex结合,使非程序员也能创作复杂数字内容并自动化生产流水线。
社区讨论
@Jason23818126的原推和@Pluvio9yte的精选帖获得了积极互动,用户赞赏这些实用、循序渐进的资源。许多人对AI驱动创作和变现的低门槛表示兴奋。一些评论强调了特定工作流的价值,如3D游戏和视频自动化,为自己的项目提供了灵感。
8月2日 10:39在 X 打开#Codex #AI tools #automation #content creation #workflow
057.0
Karpathy 分享可玩的浏览器版“鹈鹕骑自行车”LLM 测试
Andrej Karpathy 分享了一个可玩的浏览器版“鹈鹕骑自行车”测试链接,该测试最初由 Simon Willison 创建。他将源代码上传到自己的网站,使其可交互且可 fork。该测试用于评估 LLM 生成有效 SVG 图像(鹈鹕骑自行车)的能力。 这突显了一个由社区驱动的创意基准,用于测试 LLM 的空间推理和代码生成能力。Karpathy 使其易于访问,鼓励更广泛的实验和模型能力比较。这反映了人们对超越标准基准的非常规评估方法日益增长的兴趣。 该测试要求 LLM 输出有效的 SVG 代码,具有正确的几何形状、嵌套和构图,以描绘鹈鹕骑自行车的场景。Karpathy 的演示托管在 karpathy.ai/lotr-movie/,用户可直接在浏览器中查看生成的 SVG。Simon Willison 的原始基准已用于测试 2024 年至 2026 年间的 60 多个模型,结果记录在可视化时间线上。
背景
“鹈鹕骑自行车”测试是由 Simon Willison 创建的非正式 LLM 基准,要求模型生成一幅鹈鹕骑自行车的 SVG 图像。它评估空间推理、代码生成和遵循复杂指令的能力。SVG(可缩放矢量图形)是一种基于 XML 的矢量图像格式,需要精确的坐标定位。该测试作为一种有趣但具有挑战性的方式来比较 LLM 的进展而流行起来,尤其是在 2025 年底模型快速改进之后。著名 AI 研究员 Karpathy 经常分享此类社区资源以促进学习和实验。
8月2日 16:10在 X 打开#LLM #AI evaluation #demo #Karpathy
067.0
RSTGameTranslation:实时AI游戏翻译工具
RSTGameTranslation 是一款开源工具,利用 OCR 和 AI 为外语游戏提供实时屏幕翻译。它支持多种 OCR 引擎和翻译后端,包括 Gemini、ChatGPT 等云端服务,以及通过 Ollama 实现的本地翻译。该工具还具备文本转语音和游戏音频语音识别功能。 该工具解决了玩家游玩无官方中文的外语游戏时,难以理解剧情和任务这一常见痛点,无需等待汉化补丁。它支持本地 AI 模型,确保了隐私和离线能力,迎合了注重数据安全的用户。同时,它也降低了享受小众或未翻译游戏的门槛,可能扩大独立游戏和区域作品的受众。 该工具通过 OCR 捕获游戏画面中的文字,然后利用 AI 进行翻译,并将结果直接叠加在屏幕上。它可以针对特定游戏优化翻译,考虑上下文并识别角色/地点名称。通过 Ollama 或 LM Studio 可实现纯本地翻译,并包含自动更新检查功能。该项目托管在 GitHub 上,用户名为 thanhkeke97。
背景
许多游戏,尤其是日文和韩文作品,发布时没有官方中文,玩家只能靠猜测或民间汉化补丁。OCR(光学字符识别)技术从图像中提取文字,而 ChatGPT 等 AI 翻译服务或通过 Ollama 运行的本地模型则提供准确、上下文感知的翻译。实时屏幕翻译工具将翻译后的文字叠加到游戏窗口上,实现无缝游戏体验,无需切换窗口。Ollama 允许在本地运行大语言模型,确保隐私和离线使用。
8月2日 13:30在 X 打开#game translation #OCR #AI #open source #tool
077.0
本地大模型资源精选 GitHub 清单
一个名为 LLMs-local 的 GitHub 仓库被分享,它整理了一份在本地运行大语言模型的综合工具清单。内容涵盖 Ollama、llama.cpp、vLLM 等推理引擎,以及用户界面、模型、微调工具、Agent 框架、教程和硬件选购建议。 这份精选清单降低了从业者探索和采用本地大模型方案的门槛,而本地部署对于隐私保护、离线使用和成本控制日益重要。它帮助用户在快速增长的本地推理工具生态中找到方向,并根据需求做出明智选择。 该仓库收录的推理引擎包括 Ollama(基于 llama.cpp 构建)、llama.cpp(支持多种硬件的 C++ 引擎)和 vLLM(针对高吞吐量服务优化)。还列出了 Open WebUI、Lobe Chat 等用户界面,并按用途对模型进行了分类。清单还扩展到微调工具、Agent 框架、训练教程和硬件选购指南。
背景
由于隐私顾虑、延迟需求以及强大消费级硬件的普及,本地运行大语言模型变得流行。推理引擎是优化模型生成响应的软件,在硬件支持、吞吐量和易用性方面存在关键差异。Ollama 易于使用,llama.cpp 高度灵活且几乎可在任何硬件上运行,vLLM 则专为高性能服务设计。量化模型可减少内存占用,使消费级 GPU 上的本地部署成为可能。
8月2日 10:01在 X 打开#LLM #local inference #Ollama #llama.cpp #vLLM
086.0
社区热议 Opus 4.6 与 Opus 5 的写作风格和个性差异
@dotey 的一条推文凸显了越来越多用户认为 Opus 4.6 的写作风格和个性比 Opus 5 更吸引人。被引用的用户 @petergyang 批评 Opus 5 回复过长、过度使用“Claude-speak”式短语(如“here's the honest truth”),且语气过于评判。这反映了社区普遍反馈 Opus 5 的写作不够自然友好。 这场讨论之所以重要,是因为写作质量和个性是用户对 AI 助手满意度的关键因素,尤其在创意和对话任务中。如果 Opus 5 的风格被视为退步,可能会影响用户信任和采用率,特别是对于重视 Opus 4.6 亲切语气的写作者。这些反馈可能会影响 Anthropic 未来的模型微调。 对 Opus 5 的具体抱怨包括回复过长、频繁使用“here's the honest truth”等陈词滥调,以及评判性语气,这与 Opus 4.6 友好、可信赖的朋友形象形成对比。推文引用了 @petergyang 的帖子,而更广泛的 Reddit 讨论指出,尽管 Opus 5 在其他方面有所改进,一些用户仍偏爱 Opus 4.6 进行创意写作。目前尚未见 Anthropic 的官方回应。
背景
Opus 是 Anthropic 的高端 Claude 模型系列,以高级推理和细腻写作著称。Opus 4.6 因其引人入胜的个性而备受赞誉,而 Opus 5 在编程和逻辑方面有所改进,但据称改变了写作风格。“Claude-speak” 指一组冗长、过于礼貌或公式化的短语,一些用户认为不自然。该术语在社区论坛和 GitHub 项目中有所讨论,通常涉及如何让 Claude 的回复更人性化。
社区讨论
社区情绪普遍认同这一批评,Reddit 和 X 上的许多用户表达了对 Opus 4.6 写作风格的怀念。一些人认为 Opus 5 在技术任务上更优,但在创意写作上较差,而另一些人则为 Opus 5 在准确性上的改进辩护。讨论凸显了个性与性能之间的权衡。
8月2日 05:07在 X 打开#AI #LLM #Opus #writing quality #community feedback
096.0
ClaudeBar:macOS 菜单栏工具实时监控 AI 编程助手用量
ClaudeBar 是一款新的 macOS 菜单栏应用,可监控 Claude、Codex、Gemini、Copilot 等多个 AI 编程助手的用量配额。它通过颜色编码显示剩余额度,并在配额不足时发送系统通知。该工具支持自定义刷新间隔和主题切换。 开发者在用 AI 助手编码时经常忘记用量限制,导致工作中断。ClaudeBar 提供了一个统一的、一目了然的视图,帮助用户避免流程中断。这对同时使用多个 AI 工具的用户尤其有价值。 ClaudeBar 是开源的,可在 GitHub 上的 tddworks 组织下获取。它采用交通灯配色:绿色表示额度充足,黄色表示偏低,红色表示即将耗尽。该应用支持十多种 AI 编码工具,包括 Claude、Codex、Gemini、Copilot 和 Amp。用户可自定义刷新间隔并选择多种主题。
背景
像 Claude Code、GitHub Copilot 和 Gemini 这样的 AI 编码助手提供有限的免费使用额度或订阅配额。超出这些限制会导致编码会话中断,用户需等待或升级。现有解决方案包括浏览器扩展和独立监控器,但 ClaudeBar 将多个服务集成到一个 macOS 菜单栏应用中。该工具由 tddworks 社区构建,可免费使用。
8月2日 07:30在 X 打开#AI coding #developer tools #macOS #Claude Code #productivity
106.0
AuthPass:免费开源跨平台密码管理器,兼容 KeePass 格式
AuthPass 是一款免费开源的密码管理器,因其跨平台可用性和对 KeePass 格式(KDBX)的兼容性而受到关注。它支持 macOS、Windows、Linux、iOS 和 Android,并提供网页版,同时支持通过 Dropbox 和 Google Drive 进行云同步以及生物识别解锁。 AuthPass 通过使用开放的 KDBX 格式解决了常见的供应商锁定问题,用户可以在兼容应用之间自由切换而不会丢失数据。其广泛的平台支持和云同步功能,使其成为寻求免费、灵活且安全的密码管理方案用户的实用选择。 AuthPass 使用 Flutter 构建,兼容 KeePass 2.x(KDBX 3 和 KDBX 4)。它支持指纹等生物识别解锁,以及通过 Dropbox 和 Google Drive 进行云同步。该项目托管在 GitHub 上的 authpass 组织下。
背景
KeePass 是一款知名的开源密码管理器,使用 KDBX 文件格式加密存储密码。许多第三方应用都兼容此格式,允许用户在不同设备和平台上访问密码。AuthPass 正是这样一款应用,它利用 KeePass 生态系统提供现代化的跨平台体验。
8月2日 04:00在 X 打开#password-manager #open-source #KeePass #cross-platform #security
116.0
Bettercap:获19000多颗GitHub星的开源网络安全工具
来自@GitHub_Daily的一条推文重点介绍了bettercap,这是一款成熟的开源网络安全工具,在GitHub上已获得超过19000颗星。该工具包含WiFi抓包、蓝牙设备扫描、ARP欺骗、HTTP代理拦截等功能,并配有Web管理界面进行可视化操作。它还支持Docker部署和基于JavaScript的脚本定制。 Bettercap将多种基本的网络攻击和监控功能整合到一个可扩展的工具中,使其成为渗透测试人员和安全研究人员的首选资源。其活跃的社区和高星数反映了它在网络安全领域的可靠性和广泛采用。通过Web界面和Docker部署,该工具易于使用,降低了专业人员执行高级网络评估的门槛。 Bettercap的ARP欺骗模块可以针对特定主机或整个子网,通过arp.spoof.internal等选项控制本地流量重定向。官方Web界面提供了用户友好的实时监控和控制界面,并且可以使用JavaScript编写脚本以实现自定义工作流程。该工具在GitHub上的bettercap/bettercap仓库中可用,并可通过Docker快速部署。
背景
Bettercap是一个用Go语言编写的综合网络安全工具,专为渗透测试和红队行动设计。它是流行的Ettercap工具的现代继任者,提供了更好的性能和模块化架构。主要功能包括通过ARP欺骗进行中间人攻击、WiFi网络审计、低功耗蓝牙设备扫描以及HTTP/HTTPS流量操纵。该工具可以通过交互式命令行界面或基于Web的UI进行操作,并且可以通过JavaScript插件扩展其功能。
8月2日 02:25在 X 打开#cybersecurity #open-source #penetration testing #network security #bettercap
126.0
AI在数学中的应用或如国际象棋般增加对数学家的需求
@trq212的一条推文指出,AI在数学中日益重要的作用已显现出杰文斯悖论,即效率提升反而导致需求增加。作者认为,随着AI处理更多常规工作,数学家可以专注于更高层次的抽象并更有效地交流。这与国际象棋的演变相似,计算机增强了而非取代了人类棋手。 这一观点挑战了AI将取代数学家的担忧,反而表明AI可能通过让专家专注于更复杂的问题来提升该领域。如果属实,这意味着教育和研究重点将转向更高层次的推理。国际象棋的类比提供了一个历史先例,即技术增强了人类技能而非使其过时。 杰文斯悖论最初在煤炭消费中观察到,指效率提升导致资源总使用量增加。在数学中,像大语言模型这样的AI工具可以探索广阔的搜索空间但缺乏深度理解,正如美国数学协会所指出的。该推文未提供实证数据,但概念上类比了国际象棋,计算机辅助提高了对弈水平和公众兴趣。
背景
杰文斯悖论是一个经济学概念,指技术进步提高资源使用效率后,反而导致该资源的消耗速率增加。在AI与数学的语境下,它意味着随着AI使某些数学任务变得更容易,对数学工作和数学家的总体需求可能会增长。国际象棋的类比指的是计算机最初被视为对人类棋手的威胁,但最终带来了国际象棋的黄金时代,棋手更多、水平更高、训练方式革新。
8月2日 18:06在 X 打开#AI #mathematics #Jevons paradox #society