8月3日2026 · 星期一

从 13 条抓取中筛选 12 条 · twitter × 6 账号 · 01:57 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. 为何多模态(尤其是视觉)对AI在人择世界中至关重要8.0
  2. Opus 5 从文本提示生成指环王的 5500 行 Three.js 渲染8.0
  3. 阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,主打编程与协作8.0
  4. 10个爆款Codex工作流:3D游戏、视频自动化与变现7.0
  5. Karpathy 分享可玩的浏览器版“鹈鹕骑自行车”LLM 测试7.0
  6. RSTGameTranslation:实时AI游戏翻译工具7.0
  7. 本地大模型资源精选 GitHub 清单7.0
  8. 社区热议 Opus 4.6 与 Opus 5 的写作风格和个性差异6.0
  9. ClaudeBar:macOS 菜单栏工具实时监控 AI 编程助手用量6.0
  10. AuthPass:免费开源跨平台密码管理器,兼容 KeePass 格式6.0
  11. Bettercap:获19000多颗GitHub星的开源网络安全工具6.0
  12. AI在数学中的应用或如国际象棋般增加对数学家的需求6.0
018.0

为何多模态(尤其是视觉)对AI在人择世界中至关重要

@xleaps 发布的一条推文(由 @dotey 转发)澄清了AI中多模态的含义,认为视觉输入对于将模型锚定在以人为中心的环境中是不可替代的。它还透露,DeepSeek 与 Anthropic 一样,在其公开API中避免多模态输出,但内部处理视觉信号,并且企业已经在为 DeepSeek 模型嫁接视觉编码器。 这一解释通过“人择原理”戳破了多模态的炒作——红绿灯和图形界面等人类设计的系统本质上是视觉的,因此AI必须处理视觉才能有效运作。它还澄清了DeepSeek专注于纯文本输出的战略选择,这与更广泛的行业观点一致,即多模态生成是一个可与核心AGI研究分离的工程问题。 该推文强调视觉信号对于 grounding 至关重要——理解“红灯”在驾驶场景中的实际含义,而不仅仅是语义。它指出 DeepSeek 的非API、非开放权重版本可以处理视觉输入,许多企业应用正在为 DeepSeek 添加 ViT(视觉Transformer)。作者认为,长程任务和持续学习最终不可避免地需要多模态输入,尤其是视觉,以将人择的数字世界 token 化。

@xleaps@dotey 转推科普一下“多模态”的具体含义。 首先,我们虽然不认为盲人有“智力”上的缺陷,但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉,不是其他模态(文字或者语音)能够简单取代的。这里面有一个人择原理:即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统,也选择了用 2D 屏幕而非字节流表达计算机操作,因此 AI 为了在现实世界和数字世界中完成任务,必须接受人类已经接受的模态和输入。 多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界,特别是视觉信号,可以帮助模型 grounding ,比如“红灯”它到底是一个什么样的信号, 在语义上毫无问题,但在开车场景里要接近人择的感知和推理,才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型,都是人择的。 即是是纯粹追求虚幻的 AGI 目标,就以长程任务为标尺, DeepSeek 要做的长程任务,持续学习,最终也都绕不过多模态,特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言,不依赖计算机屏幕,来操作针对视觉无碍者设计的计算机,很好完成长程计算机操作任务。 AI 也会在这种选择压力下,迫使 tokenize 人择的数字视觉信号。 DeepSeek 不愿意在 AGI 的路上做多模态的输出,和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题,牵涉到如何构建扩散或者 flow match 模型,如何让输出的分布不塌陷到平均期望上,如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务,可以被通用的 AI 模型一句话调用,因此可以从通用智能里外化掉。 DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的,而且许多我知道的企业应用里,都有人在试图给 DeepSeek 嫁接一个 ViT.展开原推文收起原推文

@dotey 转推了

@xleaps

科普一下“多模态”的具体含义。 首先,我们虽然不认为盲人有“智力”上的缺陷,但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉,不是其他模态(文字或者语音)能够简单取代的。这里面有一个人择原理:即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统,也选择了用 2D 屏幕而非字节流表达计算机操作,因此 AI 为了在现实世界和数字世界中完成任务,必须接受人类已经接受的模态和输入。 多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界,特别是视觉信号,可以帮助模型 grounding ,比如“红灯”它到底是一个什么样的信号, 在语义上毫无问题,但在开车场景里要接近人择的感知和推理,才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型,都是人择的。 即是是纯粹追求虚幻的 AGI 目标,就以长程任务为标尺, DeepSeek 要做的长程任务,持续学习,最终也都绕不过多模态,特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言,不依赖计算机屏幕,来操作针对视觉无碍者设计的计算机,很好完成长程计算机操作任务。 AI 也会在这种选择压力下,迫使 tokenize 人择的数字视觉信号。 DeepSeek 不愿意在 AGI 的路上做多模态的输出,和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题,牵涉到如何构建扩散或者 flow match 模型,如何让输出的分布不塌陷到平均期望上,如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务,可以被通用的 AI 模型一句话调用,因此可以从通用智能里外化掉。 DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的,而且许多我知道的企业应用里,都有人在试图给 DeepSeek 嫁接一个 ViT.

@JundeMorsenWu

怎么还是有这么多人没懂 多模态对实现AGI真的不重要 这已经是业内两三年前的共识了 你见到盲人影响他们智力了吗 多模态是一种能力,不是一种智力 就像有的人反应快,有的人手很巧,有的人空间感很强 这些都是能力,但我们不会说有这些能力就很聪明 本质上来说,图像带来的大部分语义信息已经被压缩成语言了,剩下的像素信息对于实现机器人来说是重要的,但是一个会洗衣服,会做菜的机器人不代表他很聪明,实现了AGI,这些是能力不是智力 这就是为什么所有serious的AGI公司都在做coding和math,因为解决这些问题代表智力,解决好这些问题就离AGI更近了一步

背景
多模态AI指能够处理并整合文本、图像、音频等多种数据类型的模型。这里的“人择原理”是指人类设计的环境(如交通系统、计算机界面)是围绕人类感官模态(主要是视觉)构建的。Grounding 是指将抽象符号或 token 与现实世界指代物连接起来的挑战,确保AI以符合人类感知的方式理解概念。DeepSeek 是一家以大型语言模型闻名的中国AI公司,Anthropic 是一家同样专注于文本模型的美国AI安全公司。
社区讨论
该推文回应了一条声称多模态对AGI不重要的引用推文,将其比作盲人的智力。社区争论的焦点在于视觉仅仅是一种“能力”还是智力的基础;作者认为,虽然盲人具有智力,但他们无法驾驶汽车或使用视觉界面,因此AI需要视觉来执行现实世界任务。

8月2日 15:30在 X 打开#multimodal AI #DeepSeek #AGI #grounding #AI research

028.0

Opus 5 从文本提示生成指环王的 5500 行 Three.js 渲染

Andrej Karpathy 展示了 Opus 5 从文本提示生成指环王第一段的 5500 行 Three.js 程序化渲染。该 LLM 用了约 2 小时和 100 万 token 预算(约 10 美元)生成了自定义 3D 场景。这标志着从简单的 SVG 测试转向复杂、长周期的创意编码任务。 这展示了 LLM 处理对人类来说过于繁琐或定制化任务的能力,开启了按需生成“超定制世界”的可能。它预示着 AI 可以廉价地生成交互式、故事驱动的 3D 体验,可能改变游戏开发和创意媒体。该示例还突显了 LLM 在长周期项目中的耐力,使以前不切实际的想法变得可行。 Opus 5 编写了 5500 行代码,在三维坐标中程序化放置和动画化多边形资源。该过程耗时约 2 小时,API 使用成本约 10 美元。结果被描述为“粗糙但有趣”,LLM 因多模态感知能力有限而难以审核其工作,必须通过截图来检查进度。

@dotey引用推文1 个视频AJ 这 3D 渲染测试确实比鹈鹕骑自行车靠谱多了👍原推文媒体预览展开原推文收起原推文

@dotey

AJ 这 3D 渲染测试确实比鹈鹕骑自行车靠谱多了👍

@karpathy

We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of the Lord of the Rings, a 1M token budget (~$10) and asked for three js render of it. Opus went off for ~2 hours and wrote 5500 lines of code that (procedurally) rendered the story. It's kind of janky but fun. But it's a bit mindboggling that the LLM has to place and orchestrate various polygon assets in (x,y,z) coordinates and write code that animates it all, and that it even does anything at all. I also like this kind of examples because no one in their right mind would ever spend the time to write something this custom but LLMs have all the stamina and patience in the world, so it's an example where we go from "no one would ever do this" to "sure, why not, it's ~free". There might be a lot more. But I'm excited about creating hyper custom worlds that you can imagine dropping players into, e.g. here to participate in the LoTR story as a spectator NPC, or one of the characters, or etc. Something like an ephemeral GTA of X on demand. Last thought is that the domain of worlds/games exposes a weakness in LLMs: they can't easily audit their work because they aren't able to efficiently and natively perceive videos or play games within them. Here, Opus 5 had to very slowly and painstakingly take screenshots at different points, and it messed up a few times and created a bunch of jank. An example of raw capability (multimodal, gameplay) that I think is still quite lacking.

背景
Three.js 是一个流行的 JavaScript 库,用于在浏览器中创建 3D 图形。程序化生成使用算法自动创建内容,常用于游戏中的地形或纹理。像 Opus 5 这样的 LLM 是能够从自然语言提示生成代码的大型语言模型。Karpathy 的测试超越了简单的图像生成,转向复杂的交互式 3D 场景,展示了 AI 不断增长的创意编码能力。

8月2日 05:14在 X 打开#LLM #3D rendering #AI creativity #procedural generation #Opus 5

038.0

阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,主打编程与协作

阿里巴巴发布了Qwen3.8-Max预览版,这是其新的旗舰AI模型,拥有2.4万亿参数。该模型采用稀疏混合专家架构,支持文本、图像、视频和文档等多模态输入,上下文窗口达100万token。官方称其在编程和协作方面树立了新标杆,但尚未公布详细基准测试和许可证信息。 此次发布表明阿里巴巴持续发力,与全球领先AI模型竞争,尤其是在编程和智能体任务方面。一个拥有2.4万亿参数、100万上下文窗口的多模态模型,有望在软件开发和协作AI中实现更复杂、长周期的应用。承诺开放权重也可能加速社区创新和采用。 Qwen3.8-Max是一个稀疏混合专家模型,总参数量2.4万亿,但每个token激活的参数量未公开。它支持文本、图像、视频和文档等多模态输入,上下文窗口为100万token。目前该模型以预览版形式通过API提供,并计划很快开放权重。尚未公布具体的基准测试、定价或许可证细节。

@Alibaba_Qwen

Meet Qwen3.8-Max: A New Bar for Coding and Cowork.

背景
Qwen是阿里巴巴的大型语言及多模态模型系列,此前Qwen3-Max等版本已在编程和推理方面展现出强大性能。混合专家(MoE)架构每次推理仅使用部分参数,提高了效率。该模型顺应了增大上下文窗口和多模态能力以处理多样化现实任务的趋势。阿里巴巴此前已开放部分Qwen模型的权重,培育了开发者与研究社区。

8月3日 01:46在 X 打开#AI #LLM #Qwen #coding #model release

047.0

10个爆款Codex工作流:3D游戏、视频自动化与变现

X平台上一篇精选推文整理了10个爆款案例,展示个人如何利用OpenAI的Codex构建3D网页游戏、自动化日更视频和剪辑,甚至实现月入超10万元人民币。合集涵盖了集成img2threejs、Remotion和HyperFrames等工具的工作流,呈现了实用的AI驱动内容流水线。 这份合集标志着AI应用从单纯提高效率转向构建能产生实际收入的内容、产品和服务流水线。它降低了非技术创作者的门槛,表明只要有明确想法并持续迭代,个人就能将AI转化为可持续业务。这一趋势反映了创意产业中AI民主化的更广泛动向。 该推文链接了具体工作流:用Opus 5和Codex制作的3D网页游戏、开源Codex组合技工具包,以及让Codex拥有“无限子弹”的技能。其他亮点包括Codex结合Remotion实现日更视频涨粉过万、开源抖音工作流赚取5万多元,以及结合Codex、HyperFrames、HeyGen和声音克隆的变现流水线。还包含将工作流沉淀为GitHub上Codex Skill的教程。

@Jason23818126@Pluvio9yte 转推2 张图片一个人 + Codex,能做到什么程度? 做 3D 游戏、日更视频、自动剪辑、搭内容流水线,甚至跑出月入 10W+ 的案例 我整理了近期 10 篇高赞推文给大家参考 1、Opus 5 + Codex 制作了一个 3D 网页游戏 @ring_hyacinth https://x.com/ring_hyacinth/status/2082195227180454133 2、开源一套花了数月打造的 Codex 组合技 @gengdaJ https://x.com/gengdaJ/status/2082463900025680060 3、Codex 中文创作者 10 个顶级 Skills @JackQi82772 https://x.com/JackQi82772/status/2069599178926522741 4、Codex 5.6 + img2threejs,3D 建模创作神器 @BTCqzy1 https://x.com/BTCqzy1/status/2081220184812249464 5、如何能让你的Codex拥有无限子弹? @Saccc_c https://x.com/Saccc_c/status/2083599217407439160 6、Codex + Remotion 实现自媒体视频日更,涨粉过万 @Zesee https://x.com/Zesee/status/2072417062165635433 7、Codex自动化剪辑从0到1,开源在抖音赚了5W+的工作流 @xilo2991 https://x.com/xilo2991/status/2073752063591473242 8、Codex + Hyperframes + HeyGen +声音克隆:零基础开始自媒体变现 @Pluvio9yte https://x.com/Pluvio9yte/status/2081580929492131947 9、开源月入10w+的Codex的使用方法 @laowangbabababa https://x.com/laowangbabababa/status/2074459150323769843 10、如何把一套工作流沉淀成 Codex Skill 并上传到Github @AdrianPunk115 https://x.com/AdrianPunk115/status/2082706843466633354 很明显地感受到,大家研究 AI,已经不只是为了提高效率了 更多人开始思考怎么把 AI 变成内容、产品、服务,最终变成收入 对普通人来说,门槛正在变低。只要有一个明确的想法,愿意动手、持续迭代,就有机会把它做成真实的结果原推文媒体预览+1展开原推文收起原推文

@Pluvio9yte 转推了

@Jason23818126

一个人 + Codex,能做到什么程度? 做 3D 游戏、日更视频、自动剪辑、搭内容流水线,甚至跑出月入 10W+ 的案例 我整理了近期 10 篇高赞推文给大家参考 1、Opus 5 + Codex 制作了一个 3D 网页游戏 @ring_hyacinth https://x.com/ring_hyacinth/status/2082195227180454133 2、开源一套花了数月打造的 Codex 组合技 @gengdaJ https://x.com/gengdaJ/status/2082463900025680060 3、Codex 中文创作者 10 个顶级 Skills @JackQi82772 https://x.com/JackQi82772/status/2069599178926522741 4、Codex 5.6 + img2threejs,3D 建模创作神器 @BTCqzy1 https://x.com/BTCqzy1/status/2081220184812249464 5、如何能让你的Codex拥有无限子弹? @Saccc_c https://x.com/Saccc_c/status/2083599217407439160 6、Codex + Remotion 实现自媒体视频日更,涨粉过万 @Zesee https://x.com/Zesee/status/2072417062165635433 7、Codex自动化剪辑从0到1,开源在抖音赚了5W+的工作流 @xilo2991 https://x.com/xilo2991/status/2073752063591473242 8、Codex + Hyperframes + HeyGen +声音克隆:零基础开始自媒体变现 @Pluvio9yte https://x.com/Pluvio9yte/status/2081580929492131947 9、开源月入10w+的Codex的使用方法 @laowangbabababa https://x.com/laowangbabababa/status/2074459150323769843 10、如何把一套工作流沉淀成 Codex Skill 并上传到Github @AdrianPunk115 https://x.com/AdrianPunk115/status/2082706843466633354 很明显地感受到,大家研究 AI,已经不只是为了提高效率了 更多人开始思考怎么把 AI 变成内容、产品、服务,最终变成收入 对普通人来说,门槛正在变低。只要有一个明确的想法,愿意动手、持续迭代,就有机会把它做成真实的结果

@Jason23818126

Codex 推特上 10 个高赞内容,我整理成合集了 最近看到不少 Codex 实用内容,我精选了 10 篇把它们整理成高赞方向合集。从入门到进阶玩法,跟着看基本就能一步步上手 01 @gengdaJ Codex App 从 0 到 1 完整入门教程(界面设置、基础用法讲解、常见踩坑排查) https://x.com/gengdaJ/status/2051891231953920174 02 @ai_muzi 0 基础 AI 应用构建+上线系统教程(从想法做到项目,再到域名上线全流程) https://x.com/ai_muzi/status/2054471711718879291 03 @Pluvio9yte Chrome 插件 + 浏览器控制实战(安装配置到 Codex 操作浏览器) https://x.com/Pluvio9yte/status/2052804193946390541 04 @alin_zone Claudian 配置教程:Claude Code + Codex 双模型实战(Obsidian 双开配置方案) https://x.com/alin_zone/status/2049092355949838729 05 @eastweb3eth 5 个 Codex 必装 Skill 工具(GitHub 上实用合集) https://x.com/eastweb3eth/status/2054585858192544176 06 @lxfater Codex 深度调优 + 上下文优化四大绝招(省上下文的方法) https://x.com/lxfater/status/2053147480938971585 07 @xin_pai88825 Codex + Image2 + Figma 设计工作流(IP 出图到 Figma 落地) https://x.com/xin_pai88825/status/2054030662404071702 08 @Saccc_c Codex + HyperFrames 剪辑工作流(做视频流程) https://x.com/Saccc_c/status/2051852464400261429 09 @WEB3_furture 用 Codex 一键部署 VPS(零基础自动搭私人 VPN) https://x.com/WEB3_furture/status/2049769682467455335 10 @Lonely__MH 5 折订阅 ChatGPT Plus 全流程实测(土区省钱方法) https://x.com/Lonely__MH/status/2050968016826048899 建议按顺序先熟悉基础,再配工具和工作流,最后去做实战 这张合集整理出来供大家参考,欢迎收藏!

背景
OpenAI的Codex是一个AI编程代理,可辅助编写代码、修复错误和自动化软件任务。它能集成到各种工作流中,常与其他工具搭配使用。img2threejs可将参考图像转换为程序化Three.js 3D模型。Remotion是一个基于React的编程视频创作框架。HyperFrames是视频编辑工具,HeyGen提供AI驱动的数字人和声音克隆。这些工具与Codex结合,使非程序员也能创作复杂数字内容并自动化生产流水线。
社区讨论
@Jason23818126的原推和@Pluvio9yte的精选帖获得了积极互动,用户赞赏这些实用、循序渐进的资源。许多人对AI驱动创作和变现的低门槛表示兴奋。一些评论强调了特定工作流的价值,如3D游戏和视频自动化,为自己的项目提供了灵感。

8月2日 10:39在 X 打开#Codex #AI tools #automation #content creation #workflow

057.0

Karpathy 分享可玩的浏览器版“鹈鹕骑自行车”LLM 测试

Andrej Karpathy 分享了一个可玩的浏览器版“鹈鹕骑自行车”测试链接,该测试最初由 Simon Willison 创建。他将源代码上传到自己的网站,使其可交互且可 fork。该测试用于评估 LLM 生成有效 SVG 图像(鹈鹕骑自行车)的能力。 这突显了一个由社区驱动的创意基准,用于测试 LLM 的空间推理和代码生成能力。Karpathy 使其易于访问,鼓励更广泛的实验和模型能力比较。这反映了人们对超越标准基准的非常规评估方法日益增长的兴趣。 该测试要求 LLM 输出有效的 SVG 代码,具有正确的几何形状、嵌套和构图,以描绘鹈鹕骑自行车的场景。Karpathy 的演示托管在 karpathy.ai/lotr-movie/,用户可直接在浏览器中查看生成的 SVG。Simon Willison 的原始基准已用于测试 2024 年至 2026 年间的 60 多个模型,结果记录在可视化时间线上。

@karpathy原推文More on the pelican on the bicycle test from @simonw: https://simonwillison.net/2025/Jun/6/six-months-in-llms/ I uploaded the source here so it's playable in the browser, forkable etc. https://karpathy.ai/lotr-movie/ Look out for GTA Hobbiton dropping before GTA VI :)展开原推文收起原推文

@karpathy

More on the pelican on the bicycle test from @simonw: https://simonwillison.net/2025/Jun/6/six-months-in-llms/ I uploaded the source here so it's playable in the browser, forkable etc. https://karpathy.ai/lotr-movie/ Look out for GTA Hobbiton dropping before GTA VI :)

背景
“鹈鹕骑自行车”测试是由 Simon Willison 创建的非正式 LLM 基准,要求模型生成一幅鹈鹕骑自行车的 SVG 图像。它评估空间推理、代码生成和遵循复杂指令的能力。SVG(可缩放矢量图形)是一种基于 XML 的矢量图像格式,需要精确的坐标定位。该测试作为一种有趣但具有挑战性的方式来比较 LLM 的进展而流行起来,尤其是在 2025 年底模型快速改进之后。著名 AI 研究员 Karpathy 经常分享此类社区资源以促进学习和实验。

8月2日 16:10在 X 打开#LLM #AI evaluation #demo #Karpathy

067.0

RSTGameTranslation:实时AI游戏翻译工具

RSTGameTranslation 是一款开源工具,利用 OCR 和 AI 为外语游戏提供实时屏幕翻译。它支持多种 OCR 引擎和翻译后端,包括 Gemini、ChatGPT 等云端服务,以及通过 Ollama 实现的本地翻译。该工具还具备文本转语音和游戏音频语音识别功能。 该工具解决了玩家游玩无官方中文的外语游戏时,难以理解剧情和任务这一常见痛点,无需等待汉化补丁。它支持本地 AI 模型,确保了隐私和离线能力,迎合了注重数据安全的用户。同时,它也降低了享受小众或未翻译游戏的门槛,可能扩大独立游戏和区域作品的受众。 该工具通过 OCR 捕获游戏画面中的文字,然后利用 AI 进行翻译,并将结果直接叠加在屏幕上。它可以针对特定游戏优化翻译,考虑上下文并识别角色/地点名称。通过 Ollama 或 LM Studio 可实现纯本地翻译,并包含自动更新检查功能。该项目托管在 GitHub 上,用户名为 thanhkeke97。

@GitHub_Daily原推文1 张图片玩日文韩文的游戏,没有官方中文,靠猜剧情玩了半天也不知道任务要干嘛。 RSTGameTranslation 能在游戏画面上实时翻译,用 OCR 识别文字再调 AI 翻译,结果直接叠在屏幕上。 支持多种 OCR 引擎,翻译可以走 Gemini、ChatGPT 这类云端服务,也能用 Ollama 纯本地跑。 GitHub:http://github.com/thanhkeke97/RSTGameTranslation 还带语音合成功能,翻译结果能直接读出来,也有离线方案可以选。 玩外语游戏又不想等汉化的朋友,可以试试这个工具。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

玩日文韩文的游戏,没有官方中文,靠猜剧情玩了半天也不知道任务要干嘛。 RSTGameTranslation 能在游戏画面上实时翻译,用 OCR 识别文字再调 AI 翻译,结果直接叠在屏幕上。 支持多种 OCR 引擎,翻译可以走 Gemini、ChatGPT 这类云端服务,也能用 Ollama 纯本地跑。 GitHub:http://github.com/thanhkeke97/RSTGameTranslation 还带语音合成功能,翻译结果能直接读出来,也有离线方案可以选。 玩外语游戏又不想等汉化的朋友,可以试试这个工具。

背景
许多游戏,尤其是日文和韩文作品,发布时没有官方中文,玩家只能靠猜测或民间汉化补丁。OCR(光学字符识别)技术从图像中提取文字,而 ChatGPT 等 AI 翻译服务或通过 Ollama 运行的本地模型则提供准确、上下文感知的翻译。实时屏幕翻译工具将翻译后的文字叠加到游戏窗口上,实现无缝游戏体验,无需切换窗口。Ollama 允许在本地运行大语言模型,确保隐私和离线使用。

8月2日 13:30在 X 打开#game translation #OCR #AI #open source #tool

077.0

本地大模型资源精选 GitHub 清单

一个名为 LLMs-local 的 GitHub 仓库被分享,它整理了一份在本地运行大语言模型的综合工具清单。内容涵盖 Ollama、llama.cpp、vLLM 等推理引擎,以及用户界面、模型、微调工具、Agent 框架、教程和硬件选购建议。 这份精选清单降低了从业者探索和采用本地大模型方案的门槛,而本地部署对于隐私保护、离线使用和成本控制日益重要。它帮助用户在快速增长的本地推理工具生态中找到方向,并根据需求做出明智选择。 该仓库收录的推理引擎包括 Ollama(基于 llama.cpp 构建)、llama.cpp(支持多种硬件的 C++ 引擎)和 vLLM(针对高吞吐量服务优化)。还列出了 Open WebUI、Lobe Chat 等用户界面,并按用途对模型进行了分类。清单还扩展到微调工具、Agent 框架、训练教程和硬件选购指南。

@GitHub_Daily原推文1 张图片本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。 LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。 推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。 GitHub:http://github.com/0xSojalSec/LLMs-local 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。 打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。 LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。 推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。 GitHub:http://github.com/0xSojalSec/LLMs-local 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。 打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。

背景
由于隐私顾虑、延迟需求以及强大消费级硬件的普及,本地运行大语言模型变得流行。推理引擎是优化模型生成响应的软件,在硬件支持、吞吐量和易用性方面存在关键差异。Ollama 易于使用,llama.cpp 高度灵活且几乎可在任何硬件上运行,vLLM 则专为高性能服务设计。量化模型可减少内存占用,使消费级 GPU 上的本地部署成为可能。

8月2日 10:01在 X 打开#LLM #local inference #Ollama #llama.cpp #vLLM

086.0

社区热议 Opus 4.6 与 Opus 5 的写作风格和个性差异

@dotey 的一条推文凸显了越来越多用户认为 Opus 4.6 的写作风格和个性比 Opus 5 更吸引人。被引用的用户 @petergyang 批评 Opus 5 回复过长、过度使用“Claude-speak”式短语(如“here's the honest truth”),且语气过于评判。这反映了社区普遍反馈 Opus 5 的写作不够自然友好。 这场讨论之所以重要,是因为写作质量和个性是用户对 AI 助手满意度的关键因素,尤其在创意和对话任务中。如果 Opus 5 的风格被视为退步,可能会影响用户信任和采用率,特别是对于重视 Opus 4.6 亲切语气的写作者。这些反馈可能会影响 Anthropic 未来的模型微调。 对 Opus 5 的具体抱怨包括回复过长、频繁使用“here's the honest truth”等陈词滥调,以及评判性语气,这与 Opus 4.6 友好、可信赖的朋友形象形成对比。推文引用了 @petergyang 的帖子,而更广泛的 Reddit 讨论指出,尽管 Opus 5 在其他方面有所改进,一些用户仍偏爱 Opus 4.6 进行创意写作。目前尚未见 Anthropic 的官方回应。

@dotey引用推文可不只有我一个人说 Opus 4.6 写作是最好的😅 https://x.com/petergyang/status/2083755374994415904?s=20展开原推文收起原推文

@dotey

可不只有我一个人说 Opus 4.6 写作是最好的😅 https://x.com/petergyang/status/2083755374994415904?s=20

@petergyang

I'm feeling spicy tonight so let me just say it: I think Opus 4.6 was the Opus model with the best personality and writing style. Something's off with Opus 5 - it tends to give me overly long replies, use Claude-speak way too much (e.g., "here's the honest truth"), and is too judgemental. Opus used to be a joy to talk to like a trusted friend. Not so much anymore.

背景
Opus 是 Anthropic 的高端 Claude 模型系列,以高级推理和细腻写作著称。Opus 4.6 因其引人入胜的个性而备受赞誉,而 Opus 5 在编程和逻辑方面有所改进,但据称改变了写作风格。“Claude-speak” 指一组冗长、过于礼貌或公式化的短语,一些用户认为不自然。该术语在社区论坛和 GitHub 项目中有所讨论,通常涉及如何让 Claude 的回复更人性化。
社区讨论
社区情绪普遍认同这一批评,Reddit 和 X 上的许多用户表达了对 Opus 4.6 写作风格的怀念。一些人认为 Opus 5 在技术任务上更优,但在创意写作上较差,而另一些人则为 Opus 5 在准确性上的改进辩护。讨论凸显了个性与性能之间的权衡。

8月2日 05:07在 X 打开#AI #LLM #Opus #writing quality #community feedback

096.0

ClaudeBar:macOS 菜单栏工具实时监控 AI 编程助手用量

ClaudeBar 是一款新的 macOS 菜单栏应用,可监控 Claude、Codex、Gemini、Copilot 等多个 AI 编程助手的用量配额。它通过颜色编码显示剩余额度,并在配额不足时发送系统通知。该工具支持自定义刷新间隔和主题切换。 开发者在用 AI 助手编码时经常忘记用量限制,导致工作中断。ClaudeBar 提供了一个统一的、一目了然的视图,帮助用户避免流程中断。这对同时使用多个 AI 工具的用户尤其有价值。 ClaudeBar 是开源的,可在 GitHub 上的 tddworks 组织下获取。它采用交通灯配色:绿色表示额度充足,黄色表示偏低,红色表示即将耗尽。该应用支持十多种 AI 编码工具,包括 Claude、Codex、Gemini、Copilot 和 Amp。用户可自定义刷新间隔并选择多种主题。

@GitHub_Daily原推文1 张图片用 Claude Code 写代码写到一半,不知道额度、上下文长度还剩多少,只能等报错了才发现。 ClaudeBar 是一个高颜值的 macOS 菜单栏小工具,能实时监控 AI 编程助手的用量。 不只盯 Claude,Codex、Gemini、Copilot、Amp 等十几个工具的额度都能一起看。 GitHub:http://github.com/tddworks/ClaudeBar 额度充足显示绿色,快见底变黄再变红,还会弹系统通知提醒。支持自定义刷新间隔和主题切换。 同时用好几个 AI 编程工具的朋友,装一个随时瞄一眼,省得写到关键时候断档。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用 Claude Code 写代码写到一半,不知道额度、上下文长度还剩多少,只能等报错了才发现。 ClaudeBar 是一个高颜值的 macOS 菜单栏小工具,能实时监控 AI 编程助手的用量。 不只盯 Claude,Codex、Gemini、Copilot、Amp 等十几个工具的额度都能一起看。 GitHub:http://github.com/tddworks/ClaudeBar 额度充足显示绿色,快见底变黄再变红,还会弹系统通知提醒。支持自定义刷新间隔和主题切换。 同时用好几个 AI 编程工具的朋友,装一个随时瞄一眼,省得写到关键时候断档。

背景
像 Claude Code、GitHub Copilot 和 Gemini 这样的 AI 编码助手提供有限的免费使用额度或订阅配额。超出这些限制会导致编码会话中断,用户需等待或升级。现有解决方案包括浏览器扩展和独立监控器,但 ClaudeBar 将多个服务集成到一个 macOS 菜单栏应用中。该工具由 tddworks 社区构建,可免费使用。

8月2日 07:30在 X 打开#AI coding #developer tools #macOS #Claude Code #productivity

106.0

AuthPass:免费开源跨平台密码管理器,兼容 KeePass 格式

AuthPass 是一款免费开源的密码管理器,因其跨平台可用性和对 KeePass 格式(KDBX)的兼容性而受到关注。它支持 macOS、Windows、Linux、iOS 和 Android,并提供网页版,同时支持通过 Dropbox 和 Google Drive 进行云同步以及生物识别解锁。 AuthPass 通过使用开放的 KDBX 格式解决了常见的供应商锁定问题,用户可以在兼容应用之间自由切换而不会丢失数据。其广泛的平台支持和云同步功能,使其成为寻求免费、灵活且安全的密码管理方案用户的实用选择。 AuthPass 使用 Flutter 构建,兼容 KeePass 2.x(KDBX 3 和 KDBX 4)。它支持指纹等生物识别解锁,以及通过 Dropbox 和 Google Drive 进行云同步。该项目托管在 GitHub 上的 authpass 组织下。

@GitHub_Daily原推文1 张图片用过不少免费的密码管理工具,很多只支持某几个平台,或指定数据格式,想换工具就导不出来。 AuthPass 是一个开源的密码管理器,兼容 KeePass 格式,数据文件通用,不怕被绑死。 手机、电脑、浏览器都能用,macOS、Windows、Linux、iOS、Android 都有安装包,还提供网页版。 GitHub:http://github.com/authpass/authpass 支持指纹解锁、Dropbox 和 Google Drive 云同步,密码库可以跟着走,换设备也不折腾。 想找个免费又跨平台的密码管理工具,可以看看这个。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用过不少免费的密码管理工具,很多只支持某几个平台,或指定数据格式,想换工具就导不出来。 AuthPass 是一个开源的密码管理器,兼容 KeePass 格式,数据文件通用,不怕被绑死。 手机、电脑、浏览器都能用,macOS、Windows、Linux、iOS、Android 都有安装包,还提供网页版。 GitHub:http://github.com/authpass/authpass 支持指纹解锁、Dropbox 和 Google Drive 云同步,密码库可以跟着走,换设备也不折腾。 想找个免费又跨平台的密码管理工具,可以看看这个。

背景
KeePass 是一款知名的开源密码管理器,使用 KDBX 文件格式加密存储密码。许多第三方应用都兼容此格式,允许用户在不同设备和平台上访问密码。AuthPass 正是这样一款应用,它利用 KeePass 生态系统提供现代化的跨平台体验。

8月2日 04:00在 X 打开#password-manager #open-source #KeePass #cross-platform #security

116.0

Bettercap:获19000多颗GitHub星的开源网络安全工具

来自@GitHub_Daily的一条推文重点介绍了bettercap,这是一款成熟的开源网络安全工具,在GitHub上已获得超过19000颗星。该工具包含WiFi抓包、蓝牙设备扫描、ARP欺骗、HTTP代理拦截等功能,并配有Web管理界面进行可视化操作。它还支持Docker部署和基于JavaScript的脚本定制。 Bettercap将多种基本的网络攻击和监控功能整合到一个可扩展的工具中,使其成为渗透测试人员和安全研究人员的首选资源。其活跃的社区和高星数反映了它在网络安全领域的可靠性和广泛采用。通过Web界面和Docker部署,该工具易于使用,降低了专业人员执行高级网络评估的门槛。 Bettercap的ARP欺骗模块可以针对特定主机或整个子网,通过arp.spoof.internal等选项控制本地流量重定向。官方Web界面提供了用户友好的实时监控和控制界面,并且可以使用JavaScript编写脚本以实现自定义工作流程。该工具在GitHub上的bettercap/bettercap仓库中可用,并可通过Docker快速部署。

@GitHub_Daily原推文1 张图片网络安全领域有个老牌开源工具叫 bettercap,在 GitHub 上斩获了 19000 多个 Star。 做安全研究时常用的功能,包括 WiFi 抓包、蓝牙设备扫描读写、ARP 欺骗、HTTP 代理拦截这些都有。 GitHub:http://github.com/bettercap/bettercap 并且自带 Web 管理界面,可视化直观操作,脚本插件用 JavaScript 写,方便定制各种测试流程。 提供 Docker 快速部署,做安全研究和渗透测试的朋友值得备一个。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

网络安全领域有个老牌开源工具叫 bettercap,在 GitHub 上斩获了 19000 多个 Star。 做安全研究时常用的功能,包括 WiFi 抓包、蓝牙设备扫描读写、ARP 欺骗、HTTP 代理拦截这些都有。 GitHub:http://github.com/bettercap/bettercap 并且自带 Web 管理界面,可视化直观操作,脚本插件用 JavaScript 写,方便定制各种测试流程。 提供 Docker 快速部署,做安全研究和渗透测试的朋友值得备一个。

背景
Bettercap是一个用Go语言编写的综合网络安全工具,专为渗透测试和红队行动设计。它是流行的Ettercap工具的现代继任者,提供了更好的性能和模块化架构。主要功能包括通过ARP欺骗进行中间人攻击、WiFi网络审计、低功耗蓝牙设备扫描以及HTTP/HTTPS流量操纵。该工具可以通过交互式命令行界面或基于Web的UI进行操作,并且可以通过JavaScript插件扩展其功能。

8月2日 02:25在 X 打开#cybersecurity #open-source #penetration testing #network security #bettercap

126.0

AI在数学中的应用或如国际象棋般增加对数学家的需求

@trq212的一条推文指出,AI在数学中日益重要的作用已显现出杰文斯悖论,即效率提升反而导致需求增加。作者认为,随着AI处理更多常规工作,数学家可以专注于更高层次的抽象并更有效地交流。这与国际象棋的演变相似,计算机增强了而非取代了人类棋手。 这一观点挑战了AI将取代数学家的担忧,反而表明AI可能通过让专家专注于更复杂的问题来提升该领域。如果属实,这意味着教育和研究重点将转向更高层次的推理。国际象棋的类比提供了一个历史先例,即技术增强了人类技能而非使其过时。 杰文斯悖论最初在煤炭消费中观察到,指效率提升导致资源总使用量增加。在数学中,像大语言模型这样的AI工具可以探索广阔的搜索空间但缺乏深度理解,正如美国数学协会所指出的。该推文未提供实证数据,但概念上类比了国际象棋,计算机辅助提高了对弈水平和公众兴趣。

@trq212串推 2 条2 段you can already see Jevons paradox at work in mathematics there is more happening, it is easier to understand and mathematicians have more time to discuss it with us at higher abstraction levels demand for people who think and know about math will go up展开原推文收起原推文

@trq212串推 2 条

you can already see Jevons paradox at work in mathematics there is more happening, it is easier to understand and mathematicians have more time to discuss it with us at higher abstraction levels demand for people who think and know about math will go up

i think there are lots of parallels to what happened with chess

背景
杰文斯悖论是一个经济学概念,指技术进步提高资源使用效率后,反而导致该资源的消耗速率增加。在AI与数学的语境下,它意味着随着AI使某些数学任务变得更容易,对数学工作和数学家的总体需求可能会增长。国际象棋的类比指的是计算机最初被视为对人类棋手的威胁,但最终带来了国际象棋的黄金时代,棋手更多、水平更高、训练方式革新。

8月2日 18:06在 X 打开#AI #mathematics #Jevons paradox #society