Skip to the content.

From 88 items, 24 important content pieces were selected


  1. Opus 5.5 智能体发现两个室温磁性半导体候选材料 ⭐️ 8.0/10
  2. Cloudflare 推出面向开发者与 AI 智能体的 Web Search API ⭐️ 8.0/10
  3. Anthropic 将 Claude 日记内容举报警方,佛州女子遭重罪指控 ⭐️ 8.0/10
  4. 高通与华为签署交叉授权协议,获得 LogicFolding 芯片专利许可 ⭐️ 8.0/10
  5. Kernel Recipes 2026 发布 Sashiko LLM 补丁审查系统更新 ⭐️ 8.0/10
  6. GitHub 发布 ReviewBench:面向 AI 代码审查的开源基准 ⭐️ 8.0/10
  7. 高速 Rust 链接器 mold 3.0.0 正式发布 ⭐️ 8.0/10
  8. 逆向解析 NovaLogic《Comanche》的体素空间地形地图 ⭐️ 8.0/10
  9. Cloudflare 修复 Containers 跨租户数据泄露漏洞 ⭐️ 8.0/10
  10. vLLM v0.31.0 发布:717 次提交、DeepSeek-V4.1-Flash 优化与权重缓存守护进程 ⭐️ 7.0/10
  11. Reflection AI 发布 5010 亿参数开放权重模型 Beam ⭐️ 7.0/10
  12. Dust:无需反向传播的 Transformer 预训练方法 ⭐️ 7.0/10
  13. ChatGPT 在伪造的《纽约客》漫画上添加真实漫画家签名 ⭐️ 7.0/10
  14. 得州一城市就对 Flock 监控记录公开申请开出逾 200 万美元账单 ⭐️ 7.0/10
  15. 苹果的隐私优先模式正面临 AI 原生化未来的挑战 ⭐️ 7.0/10
  16. 500 行代码实现 Linux 容器:经典深度解析再度走红 ⭐️ 7.0/10
  17. Simon Willison 用 Qwen3.8 27B 重跑“用文字作答的加法”实验 ⭐️ 7.0/10
  18. OpenAI 为 ChatGPT 引入视觉广告与效果衡量工具 ⭐️ 7.0/10
  19. Cloudflare 将 1.1.1.1 DNS 缓存内存占用削减 100TB ⭐️ 7.0/10
  20. Async Rust:调度器究竟住在哪里? ⭐️ 7.0/10
  21. Elm 项目再迈一步,向期待已久的 v1 版本靠近 ⭐️ 7.0/10
  22. 精化 E-Graph:将精化类型与 E-Graph 相结合 ⭐️ 7.0/10
  23. Dostoevsky:通过自适应跳过冗余合并优化 LSM-tree 的时空权衡 ⭐️ 7.0/10
  24. CedarDB 将原版《毁灭战士》移植到 SQL 上运行 ⭐️ 7.0/10

Opus 5.5 智能体发现两个室温磁性半导体候选材料 ⭐️ 8.0/10

Vals AI 报告称,一支由 Claude Opus 5.5 智能体组成的团队利用量子力学模拟筛选晶体,找出两个候选的室温磁性半导体,二者均为反铁磁性,其中一个是为此次任务新设计的化合物,另一个则是 1999 年就已被合成的材料。智能体使用了两个精度层次的密度泛函理论计算(较快的 PBE+U 与较慢但通常更精确的 HSE06),所报告的带隙与自旋窗口数据来自 HSE06 结果。 如果这些候选材料能通过实验验证,室温磁性半导体将对下一代计算机存储器和自旋电子器件意义重大,因为它们让电子自旋(而不仅仅是电荷)能在常温下被调控。这一结果同时也是对“大语言模型智能体是否真能显著加速材料发现”的一次检验,若成立将改变计算化学团队分配研究精力的方式。 这些发现完全是计算预测,而非实验合成;而 DFT 在半导体带隙和铁磁性计算上本就以不可靠著称,这也正是团队用更昂贵的 HSE06 泛函进行交叉验证的原因。关键在于,博客把两个候选材料都描述为反铁磁体——净磁化为零,但仍能按自旋区分电子——因此它们并不是大多数人印象中类似冰箱贴的铁磁体。

hackernews · outlier99 · Oct 5, 21:00 · 社区讨论

背景: 密度泛函理论(DFT)是一种计算量子力学方法,在物理与材料科学中被广泛用于从电子密度出发计算原子、分子和固体的电子结构;自 1970 年代以来,由于成本远低于基于波函数的传统方法,它一直是固态物理的主力工具。磁性半导体是同时具备半导体电荷输运与磁性自旋有序的材料,而要让磁性在室温下依然存在且能通过电场调控,长期被视为该领域的未解难题。这条新闻也处于更宏观的“AI for Science”趋势之中,即用大语言模型智能体驱动自动化模拟与搜索流程,遍历庞大的化学空间。

参考链接

社区讨论: Hacker News 上的反应既有关注也有质疑:有评论者提到 LK-99 事件,表示对此结果要“带着一卡车盐”来看;还有人追问智能体究竟在做什么,指出整个流程看起来仍是一次经典的 DFT 模拟。也有人反驳其表述,认为现今常用的半导体本就在室温下工作,而“室温”一词容易让人把它与室温超导体混淆;另有一位读者批评博客的引言把反铁磁体说成仅有的两类常见磁体之一,而实际上抗磁体和顺磁体要常见得多。

标签: #AI for Science, #Materials Discovery, #LLM Agents, #Density Functional Theory, #Magnetic Semiconductors


Cloudflare 推出面向开发者与 AI 智能体的 Web Search API ⭐️ 8.0/10

Cloudflare 发布了一篇更新日志,推出面向开发者和 AI 智能体的 Web Search API,让他们能够以编程方式执行网页搜索。该发布随即在 Hacker News 上引发大规模讨论(约 500 分、231 条评论),焦点集中在授权许可、结果存储与再分发权利、定价,以及 Cloudflare 是否应该横亘在开发者与搜索提供商之间。 AI 智能体越来越依赖实时网页搜索来为其回答提供依据,因此由一家主流边缘基础设施厂商提供的搜索 API,可能成为智能体技术栈中的战略层。不过,关于搜索结果能否被存储和再分发的条款,将决定开发者能否真正在此基础上构建产品——例如可分享的智能体对话记录。 讨论中提出的实际症结在于:存储与再分发权限通常深埋在服务条款之中;一位评论者引用了 Ceramic 的禁止行为清单,其中据说包含关于收集与聚合结果的条款。成本对比也被提及:据称 Gemini Flash Lite 2.5 每天免费提供 1000 次 Google 搜索,而 Flash Lite 3.x 则限制为每月 5000 次并额外按次收费;此外 SerpApi 现在也提供自有的搜索索引 API。

hackernews · tosh · Oct 5, 10:47 · 社区讨论

背景: Cloudflare 是一家重要的互联网基础设施公司,其网络、DNS 和 Workers 平台服务于互联网的很大一部分,因此其 API 被开发者广泛使用。Web Search API 是一种 HTTP 接口,允许程序提交查询并获得结构化的网页结果,这对 AI 智能体尤其有用——智能体是能够追求目标、调用外部工具并执行多步任务的 AI 程序,通常由大语言模型驱动。由于这类智能体需要最新信息而不只是预训练知识,搜索已成为智能体系统中的关键构件,与记忆、规划和编排等组件并列。

参考链接

社区讨论: Simon Willison 把核心问题归结为搜索 API 是否允许存储和再分发搜索结果,他认为若禁止存储,对于想要提供“分享对话记录”按钮等功能的智能体系统而言将是重大限制。其他开发者则争论价格问题(称赞 Gemini Flash Lite 2.5 每日免费搜索额度,而 3.x 昂贵得多),指出 SerpApi 如今运营着自己的索引,并质疑既然可以直接使用各家提供商,为何还需要 Cloudflare 居中。还有一条评论与主题无关,是关于通讯录、Apple 和 JavaScript 的个人抱怨。

标签: #web search, #API, #Cloudflare, #AI agents, #developer tools


Anthropic 将 Claude 日记内容举报警方,佛州女子遭重罪指控 ⭐️ 8.0/10

据报道,Anthropic 将一名用户与 Claude 的对话内容举报给了佛罗里达州执法部门,因为其中包含针对某警长办公室的威胁言论,该女子目前面临重罪指控。该用户称她只是把 Claude 当作私人日记使用,这引发了关于私人聊天机器人对话是否应被视为“供他人查看的通信”的争论。 此案处于强制举报义务与用户隐私预期的交汇点,可能为 AI 公司如何处理消费者对话中发现的暴力威胁树立先例。它还加剧了 AI 厂商面临的两难压力——不举报会被批评失职,举报又会被指责侵犯隐私,同时也促使注重隐私的用户转向本地模型。 该项指控依据的是佛罗里达州法规 836.10,该法规定发送、发布或传播威胁杀害或伤害他人、实施大规模枪击或恐怖主义的书面或电子记录属于二级重罪,但要求该通信必须以他人可能看到的方式进行。Anthropic 针对 Claude Free、Pro、Max 等消费者产品的隐私条款与其商业产品(如 Claude for Work 和 Anthropic API)不同,而此类升级处理通常经过人工安全审查,而非完全自动化。

hackernews · emptybits · Oct 5, 05:37 · 社区讨论

背景: 大型语言模型厂商通常会扫描提示词与输出内容,以识别儿童性虐待材料、可信的暴力威胁等违规行为,并且在某些司法管辖区,它们有法律义务将部分发现上报执法部门。但用户往往把聊天机器人当作类似日记的私人倾诉对象,这就造成了一种错位:他们以为内容保密,而服务商却可以审查并披露。佛罗里达州法规 836.10 是一项针对书面威胁的法规,最初针对的是他人能够看到的通信,因此将其适用于仅单用户可见的日记内容,会带来尚未解决的法律争议。

参考链接

社区讨论: 评论者大多对 Anthropic 的两难处境表示同情,认为在 OpenAI 曾因未举报类似案件中的枪手而遭到批评之后,该公司处于“不做也错、做也错”的境地。许多人认为佛罗里达州该法规本就不该适用于无人预期会看到的私人日记内容,也有人建议集资购买本地硬件,运行经过去量化/消融处理的开源模型以实现真正私密的使用。

标签: #ai-ethics, #privacy, #llm-surveillance, #content-moderation, #ai-policy


高通与华为签署交叉授权协议,获得 LogicFolding 芯片专利许可 ⭐️ 8.0/10

据 2026 年 10 月的报道,高通已同意签署一项多年期交叉授权协议,涵盖华为 LogicFolding 芯片制造技术所依托的相关专利。该协议标志着半导体专利授权流向的一次显著逆转——一家美国主要芯片设计公司向仍被列入美国实体清单的中国企业支付许可费用以使用其技术。 这是全球半导体专利格局的一次象征性转变:长期作为西方技术净被许可方的华为,如今反过来向美国领先芯片厂商提供知识产权。这可能增强华为在海外 AI 芯片市场的地位,为美国企业如何在实体清单限制下进行知识产权授权树立先例,并迫使爱立信等竞争对手重新评估自身的专利策略。 LogicFolding 是华为 Tau Scaling(陶氏缩放)理论的物理实现架构:它不把所有逻辑电路放在单一平坦硅层上,而是把完整的逻辑电路垂直堆叠起来,据称可将面向 AI 计算的晶体管密度提升约 53%,同时因为信号在层间空间中传输距离更短而非横跨整块芯片,反而降低了发热。关键在于,该技术旨在不依赖 EUV 光刻的情况下提升性能——由于出口管制,华为无法获得 EUV 设备——其目标是在 2031 年前实现 1.4nm 级密度。

hackernews · 0xedb · Oct 5, 07:46 · 社区讨论

背景: 摩尔定律——即晶体管密度大约每两年翻一番的长期趋势——正随着平面芯片上晶体管微缩逼近物理与经济极限而放缓。先进封装与 3D 堆叠因此成为替代路径,华为的 LogicFolding/Tau Scaling 方案正是其中之一,目的是绕过美国出口管制所禁止其采购的 EUV 光刻设备。专利交叉授权在芯片行业属于常规操作,通常双方互相开放各自的专利组合;此次不同寻常之处在于授权流向的反转,以及交易一方是位列美国实体清单、该清单一般限制美国技术向其出口的企业。

参考链接

社区讨论: 评论区观点在惊叹与质疑之间分化。有人提到一位倾向中国官方立场的评论者称华为此次从高通获得净收入;另有人质疑在高华为实体清单企业的情况下,高通如何能合法达成此类协议;还有人指出 LogicFolding 在散热上的反直觉优势,并好奇爱立信会如何回应。

标签: #Huawei, #Qualcomm, #Semiconductor, #Patents, #Chip Technology


Kernel Recipes 2026 发布 Sashiko LLM 补丁审查系统更新 ⭐️ 8.0/10

在 2026 年 Kernel Recipes 大会上,Sashiko 的维护者 Roman Gushchin 发表演讲,介绍了这个由大语言模型(LLM)驱动的补丁审查系统的工作原理以及未来的改进计划。LWN 对该演讲的报道指出,Sashiko 已经成为 Linux 内核开发流程中的重要组成部分。 补丁审查长期以来一直是内核项目最难解决的瓶颈之一,因为社区根本没有足够的人手审查所有提交的代码,因此一个真正可用的自动审查系统有望切实缓解这一压力。Sashiko 的落地也使它成为大型开源项目中 AI 辅助工程最受瞩目的现实案例之一,为其他大型项目提供了可借鉴的范本。 Sashiko 被描述为一个智能体式(agentic)的 Linux 内核代码审查系统,会自动为发送到 linux-kernel 邮件列表及其他部分列表的补丁生成审查意见;它也可以在本地内核源码检出目录中直接运行,无需启动守护进程、发送邮件或更新数据库。需要注意的是,这篇 LWN 文章位于 LWN 的订阅付费墙之后,完整的技术细节需要订阅才能阅读。

rss · LWN.net · Oct 5, 15:10

背景: LWN.net 是长期专注于 Linux 内核与自由软件开发的新闻网站,其文章是记录内核社区讨论的重要资料。Sashiko 的名字来源于日本用补丁加固磨损布料的刺子绣工艺,它利用大语言模型来审查内核补丁,模拟人类维护者在邮件列表上给出的审查意见。Kernel Recipes 是一年一度在巴黎举办的 Linux 内核会议,开发者会在此向技术听众介绍正在进行中的工作。

参考链接

标签: #Linux kernel, #LLM, #code review, #AI/ML, #open source


GitHub 发布 ReviewBench:面向 AI 代码审查的开源基准 ⭐️ 8.0/10

GitHub 发布了 ReviewBench,这是一个用于评估 AI 代码审查智能体的开源、可复现基准,基于来自 187 个开源仓库的 219 个公开 pull request 构建。每个 pull request 都配有一套经人工审核的“黄金”审查结论作为基准真值(ground truth),同时该项目公开了评估方法以及经过校准、贴近生产环境的指标。 AI 代码审查智能体正越来越多地被嵌入到开发者工作流中,但此前团队缺乏一种共享且可复现的方式来比较它们的审查质量,难以在生产环境中放心采用。ReviewBench 以真实 pull request 和公开方法作为评估基础,为整个生态提供了统一的衡量标尺,可能影响厂商和工程团队评估与采用这类工具的方式。 该基准覆盖来自 187 个开源仓库的 219 个公开 pull request,采用多来源的基准真值集合,而非单一标注者的判断,并结合了校准评分与贴近生产环境的指标。它被定位为一个离线评估框架,这意味着其结果反映的是静态的审查质量,而非智能体在真实仓库工作流中的端到端实际表现。

rss · GitHub Blog · Oct 5, 15:59

背景: 基准(benchmark)是标准化的测试集,让研究人员和工程师用相同的任务和评分规则来比较 AI 系统;在软件工程中,代码审查是指在上线合并前由同伴检查所提议改动的实践。由于审查既耗时又质量参差不齐,把 AI 用于这一任务颇具吸引力,但衡量智能体给出的审查意见是否优秀并不容易,因为往往没有唯一正确答案,不同审查者的判断也会相互分歧。ReviewBench 通过收集经人工审核的审查结论作为参考集,并定义贴近真实开发需求的指标来应对这一问题,而不是单纯依赖模型输出与参考答案的文本重合度。

参考链接

标签: #AI code review, #benchmark, #GitHub, #code review agents, #evaluation metrics


高速 Rust 链接器 mold 3.0.0 正式发布 ⭐️ 8.0/10

由 Rui Ueyama 用 Rust 编写的高性能链接器 mold 发布了 3.0.0 版本,这是该项目的第三个大版本,已在 GitHub 上公布。3.0.0 的主版本号跃升表明项目进入了一个新的重要里程碑,具体改动清单记录在该仓库的发布说明中。 链接器位于几乎所有原生构建流程的最后一步,因此它的速度直接决定了 C、C++ 和 Rust 项目的编译耗时以及 CI 流水线的完成速度。mold 3.0.0 对系统工程师和工具链工程师而言意义重大,因为 mold 已成为 GNU ld、gold 和 LLVM lld 最主要的直接替代品,而 3.0.0 这一大版本可能会影响各发行版和构建系统对默认工具链的选择。 mold 被设计为现有 Unix 链接器的直接替换方案,利用 Rust 的深度多线程来实现高速;根据项目自身的基准测试,它比 GNU 的 BFD 链接器快数倍,也比 LLVM 的 lld 略快。由于其目标是与现有链接器直接兼容,采用它通常只需让编译器驱动指向新链接器(例如通过 -fuse-ld=mold),而无需修改构建脚本。

rss · Lobsters · Oct 5, 14:24

背景: 链接器是工具链中的一个组件,它把编译器或汇编器产生的中间目标文件合并成可执行文件或共享库,并把每个符号引用解析到其定义处。GNU ld(BFD)和 gold 等传统 Unix 链接器长期以来是大项目的性能瓶颈,链接一个大型二进制文件往往需要数秒甚至数分钟。mold 由 Rui Ueyama 发起并用 Rust 编写,目的正是在保持与 GCC、Clang 等现有工具链兼容的前提下,让这一环节的速度大幅提升。

参考链接

标签: #linkers, #toolchain, #build-systems, #software-engineering, #open-source


逆向解析 NovaLogic《Comanche》的体素空间地形地图 ⭐️ 8.0/10

pikuma.com 上的一篇新技术文章记录了对 NovaLogic 1992 年 MS-DOS 游戏《Comanche: Maximum Overkill》所附带地形地图文件的逆向工程过程。作者用十六进制编辑器检查原始字节后发现,游戏使用的 .DTA 地形文件其实是标准的 8 位 PCX 图像,只是文件头的头 8 个字节被替换成了签名 “Kyle DTA”,从而揭示了 Voxel Space 渲染器所需的 heightmap(高度图)与颜色数据是如何存储的。 Voxel Space 引擎是 1990 年代初最具影响力的地形渲染技术之一,破解其数据格式为复古游戏开发者、图形程序员和数字保存工作者提供了一条实际可行的路径,可以加载并修改原始游戏资源。这也说明,在一个通用文件格式之上做少量字节的定制,就足以把整套渲染管线隐藏长达三十年之久。 关键突破在于识别出这些 .DTA 文件在被修改的文件头之下仍保留了合法的 PCX 结构,因此只要处理好那 8 字节的 “Kyle DTA” 签名,就能用标准图像工具提取出高度图和调色板/颜色平面。文章是一份逐字节检查的实操指南,也就是说该方法依赖于十六进制编辑器的操作,以及同时对 PCX 格式和 Voxel Space 光线投射循环的理解,而不是依靠任何泄露的源代码。

rss · Lobsters · Oct 5, 10:45

背景: Voxel Space 是 NovaLogic 开发的 2.5D 地形渲染算法,最早用于 1992 年的《Comanche: Maximum Overkill》,这是第一款基于体素技术的商业飞行模拟游戏。它不使用多边形,而是在一张高度图和一张配套的颜色图上投射射线,从前到后绘制垂直列,从而营造出起伏的 3D 地形效果;最初的引擎完全用汇编语言编写。其成果比同时代基于多边形的游戏呈现出更自然、更逼真的地形,这也是该技术至今仍被研究和重新实现的原因,例如在 TIC-80 及其他现代演示程序中都能见到。

参考链接

标签: #reverse engineering, #game development, #terrain rendering, #retro computing, #voxel graphics


Cloudflare 修复 Containers 跨租户数据泄露漏洞 ⭐️ 8.0/10

Cloudflare 披露,外部安全研究团队 Accomplish 在其 Containers 产品中发现了一个跨租户数据泄露漏洞,某个客户的工作负载可能恢复同一台物理主机上其他租户遗留的磁盘残留数据。Cloudflare 发布了详细说明,介绍该漏洞的成因、调查过程以及所采取的修复措施。 租户隔离是所有多租户云平台最基本的信任前提,因此在共享硬件上发生客户间的数据泄露,会直接削弱用户对 Cloudflare 较新的 Containers 与 Sandboxes 产品的信心。这对任何在共享基础设施上运行不可信或第三方代码的用户都尤为重要,也说明容器复用与存储清理仍是云安全中反复出现的风险类型。 据 BleepingComputer 和 CybersecurityNews 报道,该漏洞源于存储空间在被复用前未对先前工作负载的磁盘残留数据做充分隔离,影响拥有 Workers Paid 账户的客户的 Containers 与 Sandboxes 服务。Cloudflare 强调该漏洞由外部研究人员发现,并已在其全球多租户基础设施上完成修复。

rss · Lobsters · Oct 5, 23:03

背景: Cloudflare Containers 让开发者可以在 Cloudflare 全球网络上把无服务器容器与 Workers 一起运行,自动完成部署位置选择,无需管理 Kubernetes 集群或手动选择区域。多租户指的是同一软件实例或同一台物理主机同时服务多个相互独立的客户,尽管共享硬件,各自的数据资产仍必须保持逻辑隔离,就像不同储户共用一家银行但资产完全分开。当容器实例被销毁、宿主资源被回收时,如果数据未被彻底清除,原则上就可能被下一个租户读取——这正是本次事件所体现的典型残留数据泄露风险。

参考链接

标签: #cloudflare, #security, #containers, #multi-tenancy, #vulnerability


vLLM v0.31.0 发布:717 次提交、DeepSeek-V4.1-Flash 优化与权重缓存守护进程 ⭐️ 7.0/10

vLLM 发布了 v0.31.0,该版本包含来自 307 位贡献者(其中 96 位是新贡献者)的 717 次提交。核心亮点是一大批 DeepSeek-V4.1-Flash 性能优化(带 V4.1 NVFP4 压缩 KV 缓存的 FlashMLA mega attention 已成为 SM100 上的默认实现、DeepGEMM 稀疏 MQA logits、将 gate GEMM 与专家选择融合的 Mega-Gate、融合的 MoE 与张量并行路径),以及新的 vllm preload 命令行工具——它启动一个权重缓存守护进程,让量化后的权重在引擎重启之间常驻 GPU 显存。 vLLM 是目前部署最广泛的开源大模型推理与服务引擎之一,因此它每个版本在性能和稳定性上的改进都会迅速传导到部署 DeepSeek 级别 MoE 模型的生产环境中。快速重启的权重缓存和新的调度控制能力,直接缓解了大规模、多租户或强化学习场景下的运维痛点——引擎重启和 KV 显存压力正是这类负载最常见的故障来源。 该版本还引入了 vllm snapshot create/restore(基于 CRIU 的实验性机制,可恢复一个完全初始化的 TP1 引擎),以及 LiLiCorr、DFlash 异步调度、面向 Gemma4 的 DSpark 自适应验证等投机解码能力;在线量化 quantization="fp8" 被 fp8_per_tensor 简写取代,tokenizer_mode="slow" 和 AllSpark INT8 W8A16 后端被移除,逐请求的多模态 kwargs 现在必须设置 --trust-request-mm-kwargs 才被接受。值得注意的是,新的权重缓存存在一个已报告的缺陷:WeightCacheKey 只对 safetensors 头部做哈希,导致仅张量数值不同的两个 checkpoint 可能发生冲突。

github · khluu · Oct 5, 06:44

背景: vLLM 是一个开源的大语言模型高吞吐推理服务引擎,以 PagedAttention 和连续批处理(continuous batching)而闻名。像 DeepSeek 这样的 MoE(混合专家)模型每个 token 只激活部分专家子网络,要高效服务这类模型就需要融合大量小规模 GEMM 与专家选择步骤,这正是本版本中 DeepSeek-V4.1-Flash 相关工作的重点。FlashMLA 是 DeepSeek 的优化注意力算子库,而 NVFP4 是 NVIDIA Blackwell(SM100/SM103)GPU 支持的 4 位浮点格式,相比 FP8 可将 KV 缓存显存大致减半,从而提升长上下文解码与并发能力。

参考链接

标签: #llm-inference, #vllm, #release-notes, #gpu-optimization, #moe


Reflection AI 发布 5010 亿参数开放权重模型 Beam ⭐️ 7.0/10

Reflection AI 发布了 Beam,这是一个开放权重的稀疏专家混合(MoE)语言模型,总参数量达 5010 亿,激活参数为 230 亿,主要面向编程、推理和智能体(agentic)任务。公司表示该模型基于 23.8 万亿来自网页及授权专有数据集的精选 token 进行预训练,并在预训练之外投入了强化学习来提升能力。 一个 5000 亿级别、激活参数仅 230 亿的开放权重模型,为快速扩张的开放模型生态再添一位有力竞争者——而这一领域近来由 DeepSeek、月之暗面等中国实验室在前沿规模上占据主导。如果 Beam 的基准成绩经得起检验,开发者就多了一个可自行部署、用于编程与智能体任务的选项,而不必依赖专有 API。 该模型采用稀疏 MoE 架构,每个 token 只激活总参数中的一小部分,因此按社区对比数据,其预填充与解码阶段的激活参数均为 230 亿。评论者指出 Beam 没有额外的 N-gram 或 PLE 参数集,且训练 token 量少于部分竞品(约 23.8 万亿,而 DeepSeek V4.1 Flash 为 45 万亿),他们认为这可能是它在某些指标上落后于更小的免费模型的原因之一。

hackernews · Philpax · Oct 5, 19:16 · 社区讨论

背景: 专家混合(MoE)是一种把模型拆成众多专门化子网络(即“专家”)的架构,并配有一个路由机制,针对每个输入只激活相关专家,从而让总容量增长远快于单 token 的计算量。“开放权重”指训练好的参数可公开下载,但许可证仍可能限制修改或再分发,它与同时公开代码、数据和文档的完全开源 AI 有所区别。Beam 面向“智能体”任务,即模型需要规划、调用工具并在多步之间保持状态,而非只回答单条提示。

参考链接

社区讨论: 评论者对又一款开放权重模型表示欢迎,但对 Reflection 明显缺乏信任:有人回忆其早先的 70B 模型被指在后台把请求转发给 Claude,并用正则表达式从输出中删除“Claude”字样,而公司承诺的复盘说明始终没有出现。还有人质疑其演示基准的表述方式——用“才出现几天”的谜题做 180×90 网格泛化测试——并指出 Beam 参数更大,表现却据称不如中国实验室更小的免费模型。

标签: #open-weight-models, #mixture-of-experts, #llm-release, #reflection-ai, #community-skepticism


Dust:无需反向传播的 Transformer 预训练方法 ⭐️ 7.0/10

一个名为 Dust 的研究项目声称是首个在预训练 Transformer 语言模型上能与反向传播竞争的第零阶(zeroth-order)方法。它通过对每个 token 独立地扰动激活值(节点扰动)来实现,因此每个 token 相当于一个虚拟种群成员,一次前向传播即可并行评估它们全部。 如果在大规模场景下得到验证,这可能提供一条绕过限制反向传播的 Hessian 条件数瓶颈的训练路径,并有可能让大模型预训练的某些环节更易于并行化。它触及现代机器学习的根本瓶颈,因此即便是早期成果也会引发大量技术关注。 Dust 似乎比反向传播计算成本更高,但更易于并行化,因为它只依赖前向传播而无需反向梯度计算。目前结果仍处于早期阶段,尚未展示出达到前沿模型规模的大规模预训练成果。

hackernews · E-Reverance · Oct 5, 21:15 · 社区讨论

背景: 反向传播是训练神经网络的标准算法:它通过将误差在网络中反向传播来计算梯度,从而让 Transformer 等模型能够从数据中学习。而第零阶或无反向传播方法则仅利用前向评估来估计学习信号,通常通过对激活值进行受生物学启发的扰动来实现。反向传播的一个关键实践限制在于,其收敛依赖于 Hessian 矩阵的条件数,而该矩阵描述了损失曲面的弯曲程度。

参考链接

社区讨论: 评论者提出了实质性的技术问题,指出反向传播受 Hessian 矩阵条件数限制,而消除这一限制是有前景的一步。一些人想知道混合方法——对已用反向传播训练的检查点进行微调,或在不同的训练阶段应用 Dust——是否能带来额外收益,以及将该方法概括为“更昂贵但更易并行化”是否公平。

标签: #machine-learning, #transformers, #backpropagation, #training-algorithms, #research


ChatGPT 在伪造的《纽约客》漫画上添加真实漫画家签名 ⭐️ 7.0/10

ChatGPT 的原生图像生成功能在生成《纽约客》风格的漫画时,会把真实在职漫画家的签名伪造到画面上,等于把在世画家的名字安插在他们从未创作过的作品上。Nieman Lab 的报道披露了这一问题,并在 Hacker News 上引发大量讨论,有评论者指出签名不过是模型学会复现的又一种视觉元素。 伪造签名把一个抽象的“训练数据”争论变成了具体的署名与造假问题,因为带签名的画作意味着作者身份和认可,而真实画家从未给予过这种认可。这也凸显了执法上的不对称:个人复制一个文件就可能被罚款,而大型 AI 公司生成成千上万张错误署名的图像却几乎不承担法律后果。 这个签名并非刻意冒名,而是统计意义上的产物:GPT-4o 学到《纽约客》漫画通常在右下角有一道花体签名或名字,于是照葫芦画瓢地生成一个,却完全不理解署名意味着什么。C2PA 内容凭证和 Google 的 SynthID 水印等溯源标准可以把图像标记为 AI 生成,但无法阻止模型画出真人的名字;正如一位知名 AI 研究者所言,用户往往还得手动把伪造的签名擦掉。

hackernews · rdmuser · Oct 5, 22:46 · 社区讨论

背景: 《纽约客》的单幅漫画有鲜明的统一风格,而自创刊早期起,漫画家就会在画面角落签名,因此签名是一种很强的作者身份视觉信号。ChatGPT 的图像生成原生集成在 GPT-4o 中,也就是说模型调用的是它用于对话的同一套广泛视觉与文本知识,而不是一个独立的绘画系统。与此同时,OpenAI、Anthropic、Meta 等公司正面临数十起关于训练数据采集方式的版权诉讼,早期关于合理使用的判决结果好坏参半。C2PA 内容凭证等内容溯源机制正是为标明资产是否由 AI 创建或修改而生,但目前采用程度仍参差不齐。

参考链接

社区讨论: 评论者普遍认为核心问题不在模型会这么做,而在于无人制止:有人称这是“抄袭即服务”(Plagiarism as a Service),也有人感叹伪造一个签名或盗版一首 MP3 都会招致惩罚,大规模的错误署名却无人追究。AI 研究者 gwern 以亲身经历证实了这一现象,表示自己用 Nano Banana Pro 和 ChatGPT 生成漫画时经常要额外加一步编辑来擦掉伪造的签名,而大多数用户根本懒得处理。也有人从技术角度解释,认为模型只把签名当成又一个视觉元素,并不理解其含义,因此出现奇怪的输出是意料之中,而非恶意行为。

标签: #AI Ethics, #Copyright, #Generative AI, #Plagiarism, #ChatGPT


得州一城市就对 Flock 监控记录公开申请开出逾 200 万美元账单 ⭐️ 7.0/10

得克萨斯州一座城市告知公共记录申请者,若要整理并脱敏其使用 Flock Safety 监控摄像头的相关文件,需要支付超过 200 万美元的费用——《得州论坛报》报道的具体金额为 230 万美元。这一高昂报价成为围绕「用 FOIA 成本估算变相阻断警方监控记录获取」这一争议的新焦点。 公共记录法是对监控部署进行民间监督的主要手段,因此动辄六七位数的处理费用即便没有改变记录的「公开」属性,也能让监督在实践中变得不可行。此事发生在 Flock 自动车牌识别网络受到全国审视的背景之下——该公司称其已覆盖 49 个州的 6000 多个社区,而这一案例也为其他城市如何用报价劝退记者和活动人士提供了先例。 该报价覆盖的是检索、审阅和脱敏影像与记录所需的人工成本;社区评论者指出,休斯敦地区另一项与 Flock 摄像头相关的申请被报价约 12.1 万美元,说明此类费用正从例外变为常态。评论者还提醒,报道标题中的「Texas City」存在歧义——争议对象是得州的北里奇兰希尔斯市(North Richland Hills),而非加尔维斯顿附近那座名为 Texas City 的城市。

hackernews · 01-_- · Oct 5, 22:05 · 社区讨论

背景: Flock Safety 是一家 2017 年成立于亚特兰大的公司,生产自动车牌识别(ALPR)摄像头、视频监控设备与枪声定位系统,并与警察部门、业主协会及私人业主签订合同。其摄像头利用光学字符识别技术读取车牌并保存车辆位置数据,民权组织将这种能力称为大规模监控。由于这些部署依据的是与地方政府签订的合同,公共记录申请往往成为公众了解数据如何被采集、共享和留存的唯一途径。

参考链接

社区讨论: 评论者普遍同情申请人,并强烈质疑脱敏这一理由:有人提到自己曾遭遇 3300 万美元的报价,建议改为主张一个规模较小但仍有代表性的样本,从而认定实际所需工时;也有人认为 Flock 的画面本质上就是公共网络摄像头数据,根本不应需要昂贵的脱敏处理。一种反复出现的观点是:如果记录的成本高到无法负担,那这座城市干脆就应撤掉这些摄像头——部分人更把高额报价解读为逃避透明的便利借口。

标签: #FOIA, #surveillance, #privacy, #Flock, #tech-policy


苹果的隐私优先模式正面临 AI 原生化未来的挑战 ⭐️ 7.0/10

Ben Thompson 在 Stratechery 发表分析文章,认为苹果以隐私为核心的封闭生态可能会输给 AI 原生平台,并直言自己第一次开始设想不再默认购买苹果产品。该文在 Hacker News 上引发了规模可观的讨论(227 分、199 条评论),话题涵盖隐私权衡、所谓“AI 鸿沟”以及 macOS 的安全实践。 如果 AI 智能体成为个人计算的主要交互入口,那些限制智能体访问权限的平台,可能会被更开放、更 AI 原生的生态所超越——这对苹果赖以维系用户默认购买习惯的忠诚度构成战略风险。这可能重塑用户选购硬件的方式、开发者构建智能体工作流的方式,以及用户愿意用多少隐私去换取生产力。 讨论聚焦于 macOS 的 TCC(透明、同意与控制)权限子系统,包括全磁盘访问授权,以及有报道称 Meta 的通用 AI 智能体 Muse 发出了引用私人 Apple Messages 对话的不请自来的通知。评论者还指出,Thompson 曾将 VNC/ARD 远程访问直接暴露在互联网上且未加过滤,而据称是 Claude 发现了这一点——这正体现了智能体驱动的工作流所带来的安全权衡。

hackernews · maguay · Oct 5, 10:05 · 社区讨论

背景: AI 智能体是能够追求目标、调用外部工具并自主执行多步骤任务的 AI 程序,通常由大语言模型驱动;而“AI 原生”指的是 AI 被内建在产品的每一层,而不是作为功能事后附加。苹果的做法是把应用沙盒化,并通过其 TCC 子系统要求软件在读取消息或全磁盘等个人数据前必须获得用户的明确同意。Ben Thompson 的 Stratechery 是平台战略分析领域被广泛阅读的信息源,因此他提出“宽松的智能体访问权限可能比苹果的隐私保障更有价值”这一论点,被视为个人计算走向的重要信号。

参考链接

社区讨论: 整体情绪褒贬不一但讨论很有实质内容:多位评论者认同苹果正在失去对未来购买决策的掌控力,并把这一转变描述为“AI 鸿沟”——即掌握 AI 原生工具的人与未掌握者之间的分化。也有人反驳 Thompson 本人,认为把 VNC/ARD 暴露在公网的人恰恰需要苹果提供的那种保护,而把全磁盘访问权限授予 Meta 这类软件就意味着隐私不会被尊重。一个共同观点是,苹果的权限提示虽然有时烦人,但它确实在做一件正确的事,只是做得并不完美。

标签: #Apple, #AI agents, #privacy, #platform strategy, #tech industry analysis


500 行代码实现 Linux 容器:经典深度解析再度走红 ⭐️ 7.0/10

lizzie.io 于 2016 年发布的一篇博客文章最近在 Hacker News 上重新走红,该文讲解如何用约 500 行代码构建一个最小化的 Linux 容器。这篇教程不依赖 Docker 等高层工具,而是从内核原语(如命名空间和 cgroups)出发,从第一性原理演示容器的实现方式。 它让开发者能够直观、底层地理解容器到底是什么,这一点很重要,因为容器已成为当今大多数云和 CI/CD 基础设施的基石。此次重新讨论也凸显了业界关于“容器是否应被视为安全边界”的持续争论。 该文的重点在于找出运行不可信代码所需的最小限制集合,作者明确主张不应把容器当作安全边界。评论者指出,这篇教程早于 cgroups v2 和较新的 seccomp 特性,并提出疑问:这些现代内核变化会在多大程度上改变其实现方式。

hackernews · mkornaukhov · Oct 5, 14:09 · 社区讨论

背景: Linux 容器建立在内核特性而非硬件虚拟化之上:命名空间让进程获得对文件系统、进程 ID、网络等资源的隔离视图,而 cgroups 则用于限制、统计和隔离进程对 CPU、内存等资源的使用。因此容器并不是轻量级虚拟机,而是一个在受限制的视图与配额下运行的普通 Linux 进程。这篇博客通过手动实现这些机制,揭开了 Docker 等工具底层工作原理的面纱。

参考链接

社区讨论: 评论者分享了此前在 Hacker News 上的提交记录,以及一些从第一性原理构建容器的个人文章;有人询问,若在 cgroups v2 和较新 seccomp 特性的今天重写这篇教程会有哪些变化。一条引人注目的讨论引用了作者“容器不是安全边界”的观点,有评论者认为既然连完整虚拟机都能被逃逸,业界就需要一种根本更好的方案。还有用户打趣地讲述自己误让 AI 编程工具白白消耗 token 去造了一个自制 Docker 克隆。

标签: #linux-containers, #namespaces, #cgroups, #systems-programming, #container-security


Simon Willison 用 Qwen3.8 27B 重跑“用文字作答的加法”实验 ⭐️ 7.0/10

Simon Willison 在本地硬件(一台 DGX Spark)上,用 Qwen3.8-27B-Q4_K_M.gguf 重跑了 Colin Frasier 在 2024 年针对 GPT-4o 做的“算出和但用文字作答”实验,关闭推理功能,并针对每个有序位数组合固定取 30 对样本(n = 5,070)。结果显示模型整体数值准确率仅为 23.57%(1,195 / 5,070),且只要任一加数超过大约六到七位数,准确率就几乎归零。 这一结果说明,当答案必须以文字而非数字形式给出时,大模型的算术能力会变得非常脆弱,因为拼写出来的数字与阿拉伯数字的分词方式差异很大。对从业者而言,这是一个具体的提醒:跑分高并不意味着在非常规输出格式下仍能可靠完成基础算术,这对在计算密集型任务中使用本地开源权重模型的人尤其重要。 实验使用的是完全相同的提示词:“What is {a} + {b}? Please write your answer in words. Do not include any other text or information, just the answer in words.”,每个位数组合随机选取 30 对样本,模型以 Q4_K_M 量化运行且关闭推理。个位数加数时准确率接近或达到 100%,但当两个加数都达到四位数以上时准确率跌至 25% 以下;整个实验是把原始图表粘贴进 Codex Remote 会话(GPT-6 Astra)来编排执行的。

rss · Simon Willison · Oct 4, 23:34

背景: 大语言模型并不把数字当作数值来看,而是当作 token 处理;分词器会把文本切成子词单元,因此“二十七”这样的文字写法与数字“27”被切分出的片段完全不同。这使得“用文字给出精确数值答案”的任务比普通的数字算术更难,因为模型既要算出结果,又要把它正确映射到一种很少以该形式出现的词序列上。Colin Frasier 最初的实验用的是 GPT-4o 和同样的措辞,并给出了类似的热力图,Willison 则把这一实验扩展到较新的开源权重模型 Qwen3.8-27B。Qwen3.8-27B 是阿里近期发布的原生多模态稠密开源权重模型,主打本地硬件部署、编程和智能体工作流。

参考链接

标签: #LLM, #arithmetic, #tokenization, #evaluation, #Qwen


OpenAI 为 ChatGPT 引入视觉广告与效果衡量工具 ⭐️ 7.0/10

OpenAI 宣布在 ChatGPT 中推出全新的视觉广告形式,并同步扩展面向广告主的衡量工具、归因合作以及品牌适配(brand suitability)控制能力。此举让 ChatGPT 从一个纯订阅驱动的产品,变成一个同时承载原生广告位的平台。 这标志着 AI 助手商业模式的一次重大转向:ChatGPT 庞大的用户规模转化为可售卖的广告库存,可能直接争夺搜索广告与社交广告的预算。广告主、内容发布方以及其它 AI 助手厂商都将被迫调整各自的平台与变现策略。 公告的核心是三部分内容:视觉化的广告单元(而非纯文字形式)、让广告主能把广告曝光与后续转化关联起来的衡量与归因工具,以及决定广告可以出现在哪些位置的品牌适配控制。值得注意的是,公告并未披露广告形式、定价、定向规则或分地区上线时间的具体细节。

rss · OpenAI Blog · Oct 5, 10:00

背景: ChatGPT 是 OpenAI 的 AI 助手,通过向用户收取订阅费以使用更高级模型而快速扩张。AI 助手是对话式的,这让广告投放变得棘手:这里没有搜索结果页可以挂横幅广告,广告形式必须融入对话或生成的回答之中。广告行业中的“归因”指的是衡量哪一次广告曝光带来了转化,而“品牌适配”指的是确保广告不会与广告主认为冒犯或与品牌调性不符的内容出现在一起。

标签: #OpenAI, #ChatGPT, #Advertising, #AI Monetization, #Product Announcement


Cloudflare 将 1.1.1.1 DNS 缓存内存占用削减 100TB ⭐️ 7.0/10

Cloudflare 通过大规模的缓存与数据结构优化,将其 1.1.1.1 公共 DNS 解析器缓存的内存占用削减了 100TB。这一优化面向其全球分布的递归解析器集群,而非单个集群。 对于一个服务全球的递归 DNS 服务来说,内存是主要的成本与容量瓶颈之一,因此释放出 100TB 内存意味着更少的机器、更低的运营成本,以及缓存更多记录、从而更快响应的余量。这同时也是一个系统工程的参考案例:同样的优化思路可以推广到 CDN、键值存储以及其他对延迟敏感的服务中。 被报道的结果是 Cloudflare 的 1.1.1.1 缓存基础设施在 RAM 占用上总共减少了 100TB,且未改变对外可见的 DNS 解析行为。不过该消息来源本身并未提供关于所采用的具体数据结构或淘汰策略的技术说明,因此现有材料中没有披露这项优化背后的实现机制。

rss · InfoQ 中文站 · Oct 5, 10:00

背景: 1.1.1.1 是 Cloudflare 提供的公共递归 DNS 解析器,用于为互联网上的任意主机把人类可读的域名翻译成 IP 地址。DNS 缓存会保存最近查询过的名称的解析结果,这样重复查询就能立即返回,而不必沿 DNS 层级重新解析,这对降低延迟至关重要。像 1.1.1.1 这样的递归解析器把这些缓存放在内存中,因此所需的 RAM 总量会随流量规模、被查询的不同域名数量以及记录的 TTL 值增长,在 Cloudflare 这种体量下内存就成了关键的扩展瓶颈。

参考链接

标签: #Cloudflare, #DNS, #Memory Optimization, #Caching, #Systems Engineering


Async Rust:调度器究竟住在哪里? ⭐️ 7.0/10

herecomesthemoon.net 上发表的一篇新文章探讨了 async Rust 中调度器究竟“住”在哪里,追问这一职责应当归属于语言与标准库、外部的异步运行时,还是操作系统本身。它并非发布新工具或新版本,而是一篇面向 Rust 与系统程序员的架构层面深度分析。 Rust 标准库刻意不提供执行器,因此 Tokio 之类的第三方运行时实际上决定了整个生态中任务如何被调度;追问调度器应当位于何处,直接触及生态碎片化、可移植性,以及 async Rust 如何与 io_uring 这类操作系统级异步 I/O 机制协作等问题。这个问题的答案会影响库作者可以做出哪些假设,也影响异步代码在不同运行时之间迁移的难易程度。 Rust 的 Future 是惰性的,除非被主动轮询,否则什么都不会发生,因此必须由执行器驱动其完成,并在公平性、工作分配和饥饿等问题上做出决策;Tokio 这类多线程工作窃取调度器与 async-executor 这类以性能换取简洁的轻量参考执行器,在设计上差异很大。文章的讨论框架还涉及这样一个观察:现代操作系统本身已经提供了高度优化的调度器和异步 I/O,这就引出了用户态运行时究竟该重复实现多少调度逻辑的问题。

rss · Lobsters · Oct 5, 18:31

背景: Rust 标准库只为异步编程提供最基础的部分——Future trait 以及 async/await 语法,而执行器、任务、反应器和组合器都由社区 crate 提供。Tokio 已成为高性能网络服务事实上的运行时,并支撑着 hyper、tonic、tower、tracing 等被广泛使用的库,因此它的调度选择影响巨大。由于 Rust 中的 Future 是惰性的、只有被轮询时才会推进,必须有人拥有那个不断轮询它们的循环,而这个“拥有者”正是人们所说的“调度器”。

参考链接

标签: #Rust, #Async, #Scheduler, #Systems Programming, #Concurrency


Elm 项目再迈一步,向期待已久的 v1 版本靠近 ⭐️ 7.0/10

Elm 项目在 elm-lang.org 上发布了一篇题为《Another step towards elm v1》的官方新闻,表明这门语言正继续朝长期推迟的 1.0 正式版推进。该文章同时指向 Lobsters 上的讨论帖,而目前提供的摘要中并没有给出具体版本号或代码变更内容。 Elm 自 2018 年起一直停留在 0.19.x,因此任何关于迈向 1.0 的官方信号,对因稳定性和长期维护顾虑而犹豫是否采用它的团队都很重要。真正进入 v1 意味着 API 与核心语义基本冻结、可以放心依赖,这对 Elm 曾深刻影响过的前端函数式编程生态具有实际意义。 目前最新的编译器版本仍是 Elm 0.19.2,它只带来了构建速度优化、没有任何语言层面的改动,这说明 0.19.x 与真正的 v1 仍是两个不同的里程碑。Elm 素以严格的语义化版本管理和编译器静态类型检查著称,官方宣称借此可在实践中消除运行时异常,这两点也决定了该项目对宣布 1.0 格外谨慎。

rss · Lobsters · Oct 5, 13:20

背景: Elm 是由 Evan Czaplicki 于 2012 年创建的纯函数式领域特定语言,用于以声明式方式构建基于浏览器的图形界面,最终编译为 JavaScript,并强调易用性、性能与健壮性。它提出的单向数据流与不可变状态架构,深刻影响了后来 Redux、React 等 JavaScript 工具的设计思路。承诺已久的 1.0 里程碑多年来反复被提及却始终未落地,因此任何关于迈向它的官方更新都会引起社区关注。

参考链接

标签: #Elm, #functional programming, #frontend, #language release, #web development


精化 E-Graph:将精化类型与 E-Graph 相结合 ⭐️ 7.0/10

Philip Zucker 发布了一篇题为《Refinement E-Graphs》的技术博客,探讨将精化类型(refinement types)与 E-Graph 结合起来用于程序分析与优化。该文属于深度探讨性质,不过聚合内容仅提供了其评论链接,并未收录完整正文。 如果精化谓词能够在 E-Graph 内部被表示和传播,等值饱和(equality saturation)就能推理比单纯语法等价更丰富的程序性质,从而有望实现更精确的优化与验证。这对依赖 egg、egglog 等 E-Graph 基础设施从事优化编译器、程序合成和形式化方法工具的研究者与工程师都具有意义。 该文作者 Philip Zucker 是 Datalog、egglog 与程序合成社区中知名的博主,文章处在两种不同技术的交汇点:精化类型(为类型附加逻辑谓词)与 E-Graph(紧凑地存储项的等价类)。需要注意,所给内容仅提供了评论页面的链接,因此无法仅凭该信息源核实文中的具体技术主张。

rss · Lobsters · Oct 5, 02:23

背景: E-Graph 是一种用于存储某个语言中项之间等价关系的数据结构,它把表达式归入由 e-node 连接的 e-class(等价类),并支撑了等值饱和(equality saturation)这一通过非破坏性重写直至不动点来构建优化编译器的技术。精化类型则是在类型上附加一个对该类型所有元素都成立的谓词,使类型能够表达前置与后置条件,例如“大于 5 的自然数”。该博客探讨把这两种思想结合后会发生什么,也就是用逻辑谓词来精化等价类,而非把它们视为可以无条件互换。

参考链接

标签: #e-graphs, #refinement types, #program optimization, #equality saturation, #formal methods


Dostoevsky:通过自适应跳过冗余合并优化 LSM-tree 的时空权衡 ⭐️ 7.0/10

论文《Dostoevsky: Better Space-Time Trade-Offs for LSM-Tree Based Key-Value Stores via Adaptive Removal of Superfluous Merging》提出了一种键值存储设计,能够根据应用负载和硬件条件自适应地在所谓的 Fluid LSM-tree 设计空间中导航,跳过对当前场景而言多余的合并操作。作者在 RocksDB 之上实现了 Dostoevsky,并声称其在性能和存储空间两方面都严格优于当前最先进的 LSM-tree 设计。 RocksDB、LevelDB、Cassandra 等基于 LSM-tree 的键值存储支撑着大量生产服务,而后台的合并(compaction)通常是其最大的开销来源。传统设计迫使工程师只能选择一个固定的调优点,在写放大、读放大和空间放大之间做取舍;因此,一种能够去除冗余合并的自适应方案有望同时改善多个维度,对数据库与存储系统从业者具有实际意义。 Dostoevsky 建立在 Fluid LSM-tree 与 lazy leveling 等既有技术之上,会依据负载以及存储设备读写带宽比等硬件特征,逐层决定是否执行合并。其代价在于:跳过合并会让同一键的多个版本滞留在更多的 run 和层级中,从而可能拖慢点查与范围扫描,除非策略能够随实际的读写比例自适应调整。

rss · Lobsters · Oct 5, 20:18

背景: LSM-tree(日志结构合并树)是许多键值存储采用的数据结构:写入先缓存在内存中,再刷写成有序文件,随后由后台的合并操作逐层整理成容量呈指数增长的层级。这种设计有利于获得高写入吞吐,但也带来写放大、读放大和空间放大这三种相互竞争的开销,必须通过合并策略来平衡。因此,合并是 RocksDB 等引擎中最核心的调优手段,而 Dostoevsky 这类研究的目标就是让这一选择自动化,而不再依赖固定配置。

参考链接

标签: #LSM-trees, #key-value stores, #database systems, #storage engines, #compaction


CedarDB 将原版《毁灭战士》移植到 SQL 上运行 ⭐️ 7.0/10

数据库公司 CedarDB 发布了一篇博客文章,介绍了他们如何把 1993 年的原版《毁灭战士》(Doom)的游戏逻辑移植为 SQL 执行,而不是运行传统的 C 代码,由数据库充当游戏的运行环境。该文章正在 Lobste.rs 上以“We ported the original Doom to SQL”为题被讨论。 这个项目是对“把关系型数据库当作通用计算引擎”的一次极端压力测试,展示了查询语言能在多大程度上被推离其原本的数据检索用途。它的意义主要在于向数据库与系统工程师直观地证明 SQL 引擎的表达能力,同时也延续了《毁灭战士》被移植到各种奇怪平台的长期传统,从而为非常规平台带来关注。 其中真正的工程看点在于,把 Doom 的 C 代码以及基于指针的内存模型翻译成 SQL 的声明式、集合式模型:游戏状态存放在数据表中,游戏主循环由查询驱动,而不是由命令式函数驱动。与大多数猎奇性质的移植一样,实际代价体现在性能上——查询引擎带来的额外间接层远慢于原生代码,因此这一项目的价值在于可行性验证和趣味性,而非可玩性。

rss · Lobsters · Oct 5, 10:27

背景: 《毁灭战士》(Doom)由 id Software 于 1993 年发布,是史上最具影响力的第一人称射击游戏之一,其源代码在 1997 年公开。正是这种开放性使它成为爱好者移植到各种离奇硬件与软件平台的首选对象,从计算器、打印机到智能冰箱不一而足,因此“能不能跑 Doom”已成为展示某个系统能力的一种公认方式。SQL 是关系型数据库的标准语言,通常用于查询和操作已存储的数据;用它来计算游戏物理、AI 和渲染是刻意反常规的做法,因为这要用声明式查询和集合运算取代过程式的控制流。CedarDB 是一家数据库公司,其数据库引擎正是承载这一实验的平台。

标签: #Doom, #SQL, #game development, #porting, #technical deep-dive