2026 09 17 HackerNews

2026-09-17 Hacker News Top Stories #

2026-09-17 Hacker News Top Stories 一句话总结 #

  1. 介绍 System One 模型和 Jev — TypeSafe AI 发布首个“系统一模型”Jev,专注快速结构化决策,速度与效率比现有 LLM 提高两个数量级,且不产生幻觉。
  2. 关于 Wayback Machine 访问的最新更新 — 互联网档案馆因大量自动化流量冲击采取保护措施,有时误伤真实用户,正在改进区分恶意机器人和真实用户的能力。
  3. 欧盟领导人为加拿大成为“准成员国”敞开大门 — 欧盟委员会主席冯德莱恩支持加拿大成为欧盟首个“准成员国”,加欧寻求更紧密合作以应对与美国日益紧张的贸易关系。
  4. Mistral X Mozilla:私密多语言 AI 浏览 — Mistral 与 Mozilla 合作,将隐私优先的开放 AI 模型集成到 Firefox 浏览体验中,强调用户控制、本地文化和开源分发。
  5. 苹果参考图像:一种可验证摄影的新方法 — 苹果推出“参考图像”系统,通过安全时间戳和隐私保护计算环境,确保 iPhone 拍摄的图像真实反映传感器内容,抵御 AI 伪造。
  6. Gemini 3.8 Live 和 3.8 Live Extended Thinking — 谷歌推出两款先进对话模型,支持实时视觉输入、97 种语言自动检测和后台工具调用,所有 AI 生成音频使用 SynthID 水印。
  7. 在 Navier-Stokes 之后,我为何仍看空 LLM — 作者认为当前 LLM 需要大量人工监督和昂贵领域专家,只有三类公司能接受全自主 LLM,泡沫破裂影响将远超前沿实验室本身。
  8. 黑客侵入了 Flock 摄像头 — 黑客攻入 Flock 摄像头并恢复加密密钥,揭示其全国性车辆监控网络如何运作,引发对执法部门滥用监控技术的担忧。
  9. 为 M4 Mac Mini 构建 Linux GPU 驱动:一个月完成 — Cody Ho 与 Niklas 通过逆向工程 Apple AGX GPU 固件,一个月内从零构建兼容 OpenGL ES 3.0 的 Linux GPU 驱动,成功运行 Minecraft。
  10. 小众编程技巧 — 作者分享一系列高杠杆的小众编程技巧(如 fzf、atuin、git log -S、ripgrep 等),建议在公司内部每天分享一个以提升团队效率。

1. 介绍 System One 模型和 Jev (Introducing System One Models and Jev) #

https://typesafe.ai/blog/introducing-system-one-models-and-jev

TypeSafe AI 是一家致力于构建机器原生智能基础设施的人工智能实验室,旨在通过自动化实现软件内的决策。创始人 Diogo Almeida 曾在 OpenAI 工作,参与了开发语言模型的方法,认为现有的聊天模型在实现自动化方面存在重大缺失。经过两年的隐秘研发和技术突破,TypeSafe AI 发布了首个 “系统一模型”:Jev。

Jev 是一种新型的前沿模型,专注于快速、结构化的决策,其设计专注于自动化,采用了一种新的模型架构和并行采样器,以实现最高效率。与现有的大型语言模型相比,Jev 在处理 “系统一” 任务时的智能水平相似,但速度和效率提高了两个数量级。Jev 主要优化结构化输出,避免生成字符串,因此不会出现幻觉(即虚构信息)。

该模型的主要特点包括:

  1. ** 训练方法 **:Jev 使用 “强化学习以实现校准决策”(RLCD),这种方法可以生成具有可验证奖励的输出,并以概率的方式提供决策结果。
  2. ** 输入与输出 **:Jev 接收无结构数据(如文本),但重点在于结构化程序状态,输出为事先定义好的类型安全的结构化值,且附带校准概率和置信度分数。
  3. ** 采样方式 **:Jev 能够并行生成所有输出,而不是像传统模型那样逐个生成,极大提高了效率。
  4. ** 成本和速度 **:Jev 的输入代币成本仅为 0.042 美元 / 百万代币,输出代币则为免费,整体响应时间在 70 毫秒至 500 毫秒之间,显著优于传统模型的响应时间。
  5. ** 应用场景 **:Jev 可以用于需要人机协作的任务(如聊天机器人、编码助手)、可验证的问题(如数学证明)、AI 驱动的工作流程、实时应用等。

TypeSafe AI 还强调了 Jev 的无幻觉性和类型安全性,这对于实现可靠的自动化至关重要。相较于现有模型,Jev 在决策时不产生类型错误,并且始终能提供决策的置信度和不确定性。

在技术结果方面,TypeSafe AI 展示了 Jev 在速度、成本和类型安全等方面的显著优势,并对其进行了详尽的验证和演示。Jev 的发布不仅是技术上的突破,也为社区和经济带来了新的应用场景。

未来,TypeSafe AI 计划进一步发展 Jev,听取用户反馈,探索更多自动化决策的应用,期待能够推动更多创新的出现。该团队还解释了 “系统一模型” 和 “Jev” 这两个名称的来源,分别源于心理学家丹尼尔・卡尼曼的研究和威廉・斯坦利・杰文斯的理论,反映了他们对机器智能未来发展的期望。


HN 热度 1784 points | 评论 472 comments | 作者:albelfio | 1 day ago #

https://news.ycombinator.com/item?id=49717558

  • 祝贺团队推出了一些真正有趣的新东西。
  • “Jev” 的标题应该更准确地反映其特点,比如 “Jev:以快速类型推断换取通用生成”。
  • 速度比较似乎存在误导性,Jev 只能生成结构化输出。
  • Jev 不能 “幻觉” 的说法可能不准确,因为它可能输出完全错误但有效的值。
  • 生成模型也可以通过适当的工具强制输出结构化结果。
  • 他们的 “不能幻觉” 的意思是对每个结果都有信心值。
  • 如果信心值高但答案错误,这仍然算作幻觉。
  • LLM 在生成高概率错误的令牌时可能会出现幻觉。
  • 没有一个人类能完全避免幻觉,因此这个标准有些奇怪。
  • LLM 能快速查找事实,这使得它们非常有用。
  • 提出更高的标准并不意味着人类可以达到,但对 LLM 的期望应该更高。
  • LLM 在不同场合表现不同,在正式场的表现应该更好。
  • 只要对生成的结果有信心值就不算幻觉,但这并不意味着完全正确。
  • Jev 的信心值与实际正确性的对应关系是关键。
  • System One 使用的 RLCD 旨在提供经过校准的概率。
  • 产生高概率但错误的答案是概率模型的固有特征。
  • 对于特定用例,Jev 的速度和成本是值得关注的。
  • Jev 在生成结构化决策方面具有前沿性,但不能与通用 LLM 直接比较。
  • 这种模型在处理特定任务时可能会比传统 LLM 更快、更便宜。
  • 讨论模型的比较和各自的适用性是工程师的工作。
  • Jev 的表现可以在特定应用中达到很高的效率。
  • 原标题的 “新前沿模型” 有些误导,应该更好地反映其特点。

2. 关于 Wayback Machine 访问的最新更新 (An update on Wayback Machine access) #

https://blog.archive.org/2026/09/15/an-update-on-wayback-machine-access/

互联网档案馆的时光机(Wayback Machine)近期受到大量自动化流量的冲击,为了保障服务正常运行,采取了一些保护措施。其中一项变化是重写了当请求被阻止并返回 429 错误时显示的信息。429 错误代表 “请求过多”。

然而,这些保护措施有时会错误地阻止真实用户的访问。如果您遇到这种情况,互联网档案馆对此表示歉意,并感谢用户在他们努力减少错误时的耐心。

他们正在逐步提高区分恶意机器人和日常依赖时光机的真实用户的能力。如果您认为自己是误被阻止的用户,可以通过发送电子邮件至 info@archive.org,提供您的操作系统、浏览器和 IP 地址,互联网档案馆会对此进行调查。


HN 热度 665 points | 评论 350 comments | 作者:ChrisArchitect | 1 day ago #

https://news.ycombinator.com/item?id=49716176

  • 网友讨论了互联网档案馆的 Wayback Machine 受到高流量自动化流量攻击的问题。
  • 许多人认为这可能是爬虫试图绕过访问限制,直接访问 Wayback Machine 的内容。
  • 一些网站为了防止内容被抓取,已选择不再在 Wayback Machine 上展示。
  • 有提到自己的网站流量中,爬虫请求占比超过 99%。
  • 讨论中提到如何区分 Wayback Machine 与伪装成其身份的恶意爬虫。
  • 一些用户表达了对 Wayback Machine 的支持,并建议捐款以支持其服务。
  • 对于用户代理的伪造,用户指出没有可靠的方法可以验证请求的合法性。
  • 有网友提到搜索引擎和 Wayback Machine 在抓取网站时的不同之处。
  • 讨论中提到 archive.today 等其他存档服务有编辑内容的行为。
  • 一些网友对主流媒体在没有公告的情况下编辑文章感到失望。
  • 有用户提议为高流量用户或爬虫设置付费访问,以帮助资助非营利机构。
  • 另有网友表示,付费可能会让内容创作者感到不满。
  • 关于爬虫的定义,网友们讨论了抓取频率与合法访问的区别。
  • 大多数网友认为 Wayback Machine 的流量与恶意爬虫的流量不可同日而语。
  • 一些用户在使用 Wayback Machine 时遇到网站屏蔽的情况,感到沮丧。

3. 欧盟领导人为加拿大成为“准成员国”敞开大门 (EU chief opens door for Canada to become ‘associate member’) #

https://www.bbc.com/news/articles/cjwyzrr9d3dko

欧盟委员会主席乌尔苏拉・冯德莱恩近日在欧洲议会支持加拿大成为欧盟首个 “准成员国” 的提议。冯德莱恩表示,她希望能够为加拿大 “打开大门”,以便在多个关键领域实现更紧密的合作。加拿大小时候总理马克・卡尼在上周提到,寻求与欧盟建立 “独特联盟”,因为该国与美国的关系日益紧张,尤其是在贸易问题上。

冯德莱恩在讲话中并未直接提到美国总统唐纳德・特朗普,但强调对加拿大的支持并不是针对其他国家的,而是为了共同的力量。她指出,加拿大和欧盟在多个重要议题上有着相似的观点,包括人工智能、气候变化和地缘政治,并且在乌克兰、国防、原材料和供应链等方面表现出了良好的合作。冯德莱恩提,欧洲和加拿大都相信民主的重要性。

尽管冯德莱恩未提供关于加拿大准成员国身份的具体细节,但她提到制造业、科技、国防、能源、关键矿产和经济安全等领域将是双方合作的重点。目前,准成员国的概念尚不存在,因此这一过程如果被批准,可能需要数年时间才能实现。

在她的讲话中,冯德莱恩还提议成立一个包括英国和乌克兰在内的欧洲安全委员会,以应对来自俄罗斯的威胁。她强调,此举是在安全问题上形成领导者格式的需要,尤其在特朗普质疑北约军事同盟的背景下更显紧迫。

同时,冯德莱恩也提到,欧盟正面临许多全球性威胁,包括家庭的生活成本问题和快速变化的技术对社会和工作的影响。她提出了多项建议,包括邀请全球最大的人工智能实验室进行对话,减少企业的官僚主义,以及针对儿童的社交媒体使用制定更严格的规定。

在处理大规模移民问题方面,冯德莱恩提到将推出一新的应急工具,以应对西班牙城市休达的移民危机。这项工具将仅在严格定义的条件下启动,且会在特定时间内使用,以确保基本人权受到保护。然而,人权组织对此表示担忧,认为该举措可能导致弱势群体,包括妇女和儿童,无法获得国际法保护。


HN 热度 645 points | 评论 825 comments | 作者:hackernj | 14 hours ago #

https://news.ycombinator.com/item?id=49724141

  • 每个国家都有其权力机制,背后常常有监控和压迫的因素。
  • 加拿大在一些政治舆论中被描绘成独特的威权国家,这种观点不完全公正。
  • 美国的监控政策(如 PATOT 法案等)显示了其在压制公民自由方面的历史。
  • 左右派的对立可能是政治操控的一种手段,实际上是公民与政府之间的斗争。
  • 对美国政治和社会现状的失望感在很多人中间普遍存在。
  • 国家间的合作与整合需要时间和努力,特别是在身份认同上。
  • 加拿大与欧洲等国的合作将是抵御非民主国家的重要措施。
  • 英国脱欧后的局势显示出国家间合作的脆弱性。
  • 中等强国的民主国家需联合以应对美中之间的压力。
  • 美国与欧洲的关系正在发生变化,未来难以预测。
  • 在全球政治重组中,加拿大与欧盟的经济和军事合作可能会带来好处。
  • 加强与欧盟的关系可能为加拿大在与美国的贸易谈判中提供更大的杠杆。
  • 加入欧盟可能并不是唯一的选择,但与其建立经济防御协定是有益的。
  • 70% 的加拿大出口依赖美国,这种单一依赖是有风险的。
  • 加拿大需要减少对美国的贸易依赖,以实现更健康的经济结构。
  • 现阶段,增加与其他国家的贸易是改善这一状况的途径。

4. Mistral X Mozilla:私密多语言 AI 浏览 (Mistral X Mozilla: Private, Multilingual AI Browsing) #

https://mistral.ai/news/mistral-x-mozilla/

今天,Mistral 与 Mozilla 宣布达成合作,旨在将隐私、控制和选择带入人们在线浏览 AI 的体验中。Mozilla 的 AI 浏览助手 Firefox Smart Window(目前处于测试阶段)将使用 Mistral 的模型来帮助用户更好地理解复杂的搜索内容、记住重要信息以及根据浏览标签提供相关的信息。Mistral 将为位于法国和北美的用户提供支持,预计不久后还会扩展到英国和德国。

这一合作具有四个重要意义:首先,开放技术需要开放分发。Mozilla 在过去 20 多年里一直在推动开放网络,而 Mistral 自首次发布以来也一直在推出开放权重的前沿模型。这个合作旨在展示开源的潜力,以服务全球用户。

其次,AI 的优化要以当地国家和文化为基础,而非简单地输出给他们。Mistral 的模型经过细化,专注于地区语言和方言,以确保每个人都能受益于理解他们当地文化的 AI。

第三,赋予人们对 AI 互动的控制权。Firefox 在隐私和控制方面有着悠久的历史,这些价值观与 Mistral 的理念相契合。双方的合作基于对用户选择、控制和开放的共同承诺,结合 Firefox 的隐私优先传统与 Mistral 的尖端开放模型,为用户的浏览体验提供自主权。

最后,Mistral 致力于将自主 AI 置于每个人的手中。虽然 Mistral 传统上专注于企业服务,但通过与 Firefox 等生态系统领导者的合作,Mistral 能够超越商业客户,触及全球消费者,使终端用户也能受益于基于用户控制、透明度和开放创新的技术。

Mistral 与 Mozilla 的合作不仅仅是产品上的合作,而是希望在浏览器这一互联网核心的地方,让不同的 AI 提供者能够竞争,并确保开源在其中有一席之地。浏览器不应是单向的渠道,而应保持互联网最初的强大特性:探索和发现不同的思想和技术的自由,用户应能自主决定下一步的方向。


HN 热度 520 points | 评论 184 comments | 作者:vertigoruntime | 16 hours ago #

https://news.ycombinator.com/item?id=49723408

  • 有人认为 Mozilla 在鼓励用户上传私人浏览历史到云端,这是不道德的。
  • 一些评论认为本地推理模型的能力尚未足够强大,不适合在大众市场的浏览器中使用。
  • 大多数普通用户可能并不关心隐私,或者对浏览器的选择不够谨慎。
  • 有观点认为小型公司可能会被大型公司收购,导致用户隐私风险增加。
  • 也有人认为只要本地模型的能力足够,用户不需要将数据发送到云端。
  • 对于普通用户来说,便捷的使用体验可能比隐私保护更重要。
  • 评论提到,使用本地推理的期望应该是根据用户的硬件能力来设定的。
  • 还有人指出,Mozilla 需要更透明地说明数据的使用方式,避免用户误解。
  • 一些人质疑 Mozilla 的业务模式,认为它依赖于与大型公司的合作。
  • 有人认为普通用户对于云服务的使用往往缺乏足够的理解,容易随意同意条款。

5. 苹果参考图像:一种可验证摄影的新方法 (Apple Reference Image: A New Approach for Verified Photography) #

https://security.apple.com/blog/apple-reference-image/

苹果公司推出了一种新的解决方案,名为 “苹果参考图像”(Apple Reference Image),旨在提供可验证的摄影。随着强大的 AI 工具的普及,用户可以轻易生成或修改逼真的图像,这使得区分真实事件的照片和经过重度修改或完全生成的合成图像变得越来越困难。在需要证明某些事件发生的情况下,仅凭图像的逼真程度已无法确立其真实性。

现代相机使用复杂的图像处理算法来生成最终可视图像,因此,证明一张图像确实反映了相机传感器所捕获的内容,需要建立一条覆盖传感器及其计算摄影软件的信任链。现有基于 C2PA 标准的行业方法是在拍摄后附加来源元数据,认证图像编辑历史,但这种方法在编辑链的任何环节都可能被攻破,且观众无法检测到这种失败。

苹果的 iPhone 被视为全球最流行的相机,也是最安全的消费移动设备,因此苹果公司有能力解决这个问题。苹果参考图像为用户提供了一种安全时间戳的参考图像创建方式,准确反映 iPhone 相机传感器所捕获的内容。该系统具有强大的安全性,能够抵御各种攻击,且在图像处理时保护用户隐私。

苹果参考图像的核心要求包括:

  1. 语义真实性:参考图像必须真实反映传感器捕获的内容。
  2. 抵御妥协:图像的真实性不能因相机传感器的篡改或软件层面的越狱而受到影响。
  3. 隐私保护:外部观察者无法确定一对参考图像是否来自同一设备,图像内容不会被苹果或其他任何人看到。

苹果参考图像通过结合专为 iPhone 18 Pro 和 iPhone 18 Pro Max 设计的图像传感器和隐私保护计算环境,确保了可靠的数据捕获。系统的设计考虑了广泛的攻击方式,并构建了抗攻击的防护措施,包括针对量子攻击的加密防护。此外,苹果参考图像还建立了撤销系统,能够在发现欺诈图像的情况下撤销个别照片或特定传感器拍摄的所有照片。

在隐私保护方面,苹果参考图像避免了使用显性或隐性公共凭证,确保摄影师在冲突区域等危险环境中仍可保持匿名。苹果参考图像最终由苹果的签名服务进行签名,确保了图像的真实性而不暴露摄影师的身份。

苹果参考图像通过这三项核心要求的实现,设定了行业内的安全新标准,为用户提供可信的图像验证方式。具体的技术细节包括在设备制造过程中建立基础,图像捕获流程的安全性,时间戳的生成及图像签名的过程等。这些技术细节确保了苹果参考图像的强大安全性和隐私保护,使其在现有图像来源系统中脱颖而出。


HN 热度 497 points | 评论 329 comments | 作者:imwally | 22 hours ago #

https://news.ycombinator.com/item?id=49721322

  • 苹果的新技术很聪明,具有潜在的身份验证和保险应用价值。
  • 尽管对新闻工作者的用例是公关故事,但在身份验证方面的应用更为重要。
  • 苹果参考图像不等于身份系统,而是确保图像未被篡改。
  • 即使某些国家的行为者能够伪造,这在保险和身份验证场景中仍然是有效的。
  • 反对者指出,很多人只会通过截图来 “验证” 图像,而不是查看原始图像。
  • 第三方应用程序将能够验证苹果参考图像,并可以与主图像进行比较。
  • 虽然苹果参考图像本身不能追踪到用户,但可以用于验证身份。
  • NFC 技术在身份验证方面也可以是一个有用的工具。
  • 有人认为现代身份证件上的 NFC 芯片更为可靠,而非依赖图像。
  • 苹果参考图像的实施可以提升图像真实性验证的可信度。
  • 一些用户认为即使图像真实,仍需物理文件的真实性才能进行有效验证。
  • 最后,若苹果能够识别图像来源,可能会引发隐私担忧。

6. Gemini 3.8 Live 和 3.8 Live Extended Thinking (Gemini 3.8 Live and 3.8 Live Extended Thinking) #

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

谷歌最近推出了两款先进的对话模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。这些模型旨在通过增强的智能和并行推理能力,提升与人工智能的互动体验,使得语音交流更加自然和直观。

Gemini 3.8 Live 主要侧重于规模和成本效益,结合了对话智能、流畅对话和视觉信息处理的能力。其用户反馈良好,在用户偏好上位列第二。该模型的设计目标是为开发者和企业提供可靠的生产 - ready 语音代理,尤其在复杂任务处理上表现出色。与此同时,Gemini 3.8 Live Extended Thinking 则是为高复杂度任务打造的,具备更强的智能和多步骤推理能力,在人工分析的语音质量指数中取得了第一名,并在代理任务完成率方面也表现优异。

这两款模型在实时推理和语音交互上具有显著的进步。Gemini 3.8 Live 可以在接近实时的情况下处理视觉输入,并支持在对话中自动检测和切换 97 种语言。此外,它能够在后台执行工具和 API 调用的同时,保持与用户的对话流畅进行。Gemini 3.8 Live Extended Thinking 则在处理复杂工作流时,能够同时进行推理和语音交流,通过早期的口头提示和实时进度叙述来增强用户体验。

在与其他平台的整合方面,Gemini Live API 支持诸如 Agora、Fishjam、LangChain 等多个开发者平台,帮助开发者轻松构建和部署高性能的语音驱动界面。谷歌还与 Salesforce、Genspark 和 Lumeris 等公司合作,展示了这两款模型在延迟、流畅性和工具调用能力上的优势。

为了确保透明度,所有由 AI 产品生成的音频都使用了 SynthID 水印。这种不可察觉的水印直接嵌入音频输出中,确保 AI 生成的内容可以被检测到,从而帮助防止虚假信息的传播。

当前,Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 正在逐步推出,开发者可以通过 Gemini API 和 Google AI Studio 访问,企业用户在 Gemini Enterprise 中也能进行私密预览,并即将推出给客户体验使用。普通用户可以在 Search Live 中体验这些新功能。


HN 热度 480 points | 评论 322 comments | 作者:leumon | 1 day ago #

https://news.ycombinator.com/item?id=49715947

  • 一些用户在使用 Gemini 与非英语语言(如阿非利堪斯语、加泰罗尼亚语、汉语等)进行对话时感到惊讶。
  • 许多人认为 Gemini 在处理小众语言方面表现出色,能够流畅地进行交流。
  • 用户分享了使用 Gemini 进行语言学习的乐趣,并且重拾了使用母语的快乐。
  • 一些用户提出希望未来的 AI 模型能够更好地支持小众语言。
  • 讨论中提到 AI 在不同语言环境中的表现可能存在显著差异。
  • 有用户指出教育中 “估算” 的文化差异,影响了交流和理解。
  • 部分用户认为 AI 可以通过多语言词库帮助弥补其在概念推理方面的不足。
  • 一些人分享了在驾驶时使用 Gemini 进行问答的乐趣,认为它能提供有趣的知识。
  • 用户们对 AI 在处理各种方言和口音时的能力表示赞赏。
  • 有人对语言学习应用程序的潜力表示兴趣,认为 AI 语音聊天可以帮助更好地练习语言。

7. 在 Navier-Stokes 之后,我为何仍看空 LLM (Why I’m still bearish on LLMs after Navier-Stokes) #

https://dank.systems/posts/2026-09-15-ai-bear.html

前沿实验室的估值建立在“即将完全替代知识工作者”的叙事上,但当前模型即使执行最简单任务也需要大量人工监督和护栏。模型只在训练任务的邻近范围内泛化良好,轻微扰动就会失败或出现奖励黑客行为。

解决奖励黑客需要领域专家进行严格规范,但这类专家稀缺且成本高昂,往往超过直接实现的成本。多数任务无法采用“一次规范、持续实现”的模式,规范本身也会随实现洞察而演变。作者指出,Navier-Stokes 这类纯数学问题是最有利于智能体工作的场景,因为定理陈述本身就是严格规范,且验证器经过审计;但绝大多数人类知识工作并非如此。

人类审查作为替代方案无法扩展到大模型输出规模,且专家审查也易受奖励黑客攻击(如 xz 后门事件)。因此,LLM 在多数领域更像“有缺陷的实习生”,需要成年人监督,无法真正自主。

作者认为只有三类公司能接受全自主 LLM:能廉价承担失败的(如快速原型)、任务狭窄且有现成护栏的(如客服)、本就承担严格规范与验证成本的(如芯片设计、药物研发)。前两类对价格敏感,更适合廉价开源模型;第三类也可能因“群体宽度”优势而倾向使用便宜模型,且出于 IP 保密不愿将数据交给前沿实验室。

最后,作者预测即使前沿实验室叙事破灭,“数据中心装满天才”的自主场景与“脑残群体”受人类协调者瓶颈约束的场景,其算力需求差异巨大,泡沫破裂的影响将远超前沿实验室本身。


HN 热度 454 points | 评论 597 comments | 作者:jaykru | 1 day ago #

https://news.ycombinator.com/item?id=49715927

  • LLMs 的实际可实现价值有限,适用的公司类别不多。
  • 适合使用完全自动化 LLM 的公司主要有三类:可以接受失败成本的公司、需要执行一小组明确任务的公司、以及能够接受严格规范与验证的公司。
  • 第一类和第二类公司对价格敏感,可能不需要使用最前沿的模型。
  • 第三类公司已经承担了大量的规范和验证成本,LLM 的引入并未带来革命性的变化。
  • 在视频游戏开发中,使用 AI 生成代码有效降低了缺陷率。
  • 在 Web 应用开发中,LLM 生成的良好测试用例改变了开发方式。
  • 测试代码虽然复杂,但有效提高了测试覆盖率。
  • 软件工程需求依然旺盛,AI 并不能完全替代人类开发者。
  • 人们担心软件工程师的职业门槛提高,剩下的职位将需要更高技能。
  • 软件质量期望将随生产力提升而提高。
  • AI 在项目管理中仍需人类判断和参与。
  • 在市场研究和创意生成方面,LLM 具有辅助作用,但无法完全取代人类的决策。
  • 客户服务中使用 AI 的效果不佳,常常让人失望。
  • 许多公司对客户服务的投入不足,AI 常常只是权宜之计。
  • LLM 的应用仍需持续观察和探索,未来的潜力和局限性需认真评估。

8. 黑客侵入了 Flock 摄像头 (Hackers Got Inside a Flock Camera) #

https://www.wired.com/story/hackers-flock-camera-data-shows-how-system-works/

一群黑客集体名为 stegan0gram 成功攻入了一台 Flock 摄像头,并获得了其内部存储的数据。这些数据揭示了 Flock Safety 摄像头如何跟踪车辆和人的动向,黑客们将这些数据分享给了 404 Media 和 WIRED,供后者进行分析。这次数据泄露提供了前所未有的视角,展现了 Flock 所称的 “受设备加密保护” 的系统如何实际运作。

黑客们表示,他们通过拆卸摄像头并复制存储数据的方式获取了数据,并成功恢复了存储在设备上的加密密钥,从而解锁了数千个车辆检测视频。尽管摄像头的许多敏感数据仍然保持加密状态,分析后恢复的数据表明,该设备的软件能够明确检测到人、车辆、车牌以及自行车。摄像头能够对经过的每辆车拍摄多张图片,并在几周的日志中记录了超过 160 万个图像。其计算机视觉软件有时还会识别出汽车的保险杠贴纸和其他图形。

这一行为显示出,并非所有人都愿意仅仅摧毁或移除这些摄像头。美国各地有多人因涉嫌破坏或干扰 Flock 的摄像头而被逮捕。为此,一些城镇决定停止使用 Flock 的摄像头,而有的警察局甚至制作了假 3D 打印的 Flock 摄像头外壳,以引诱潜在的破坏者。黑客在采访中表示:“为什么要仅仅摧毁它们,我们可以逆向工程,找出那些监视我们的人的秘密。”

Flock 的摄像头拍摄经过的车辆,并将图像和其他数据发送到公司的服务器,在那里,Flock 的系统会读取车牌并识别车辆的颜色、品牌和型号。这些时间戳记录可以被拥有或访问这些摄像头的地方机构搜索。在许多情况下,Flock 的系统还允许全国各地的其他警察部门进行搜索。例如,在乔治亚州的阿尔法利塔,WIRED 发现该市的 Flock 摄像头记录可供超过 2000 个机构访问,包括警察局、大学、机场等。

这种全国性的网络是 Flock 的一个卖点,但也引发了巨大的争议。404 Media 披露,地方警察在国家网络中代表移民与海关执法局(ICE)进行查询,甚至在一些禁止与移民当局合作或转移车牌数据的地区。还有报道显示,德克萨斯州的一名警察全国范围内搜索 Flock 摄像头,以寻找一名自行进行堕胎的女性。这些事件引发了全国范围内关于社区是否希望在其地区使用 Flock 摄像头或自动车牌读取器的讨论。

在 stegan0gram 的案例中,显然答案是否定的。黑客表示,他们能够访问摄像头上的 Android 系统,并发现其硬盘的两个分区。其中一些分区未加密,包括一个名为 “vendor” 的分区和另一个名为 “media” 的分区。后者包含一个解锁其他部分的加密密钥,该部分存储着摄像头拍摄的大部分媒体文件 —— 视频和静态图像。


HN 热度 452 points | 评论 210 comments | 作者:driverdan | 11 hours ago #

https://news.ycombinator.com/item?id=49726586

  • 硬编码的凭据显示了完全的无能,Flock 使用的 API 密钥可能导致对其服务器的访问。
  • Flock 在安全性方面的多次漏洞显示他们对隐私和安全毫无关心。
  • Flock 的漏洞披露政策实际上限制了有效的漏洞报告,尤其是涉及设备交互和数据下载的情况。
  • 有人认为 Flock 在安全性上的疏忽与他们的商业利益有关,而不是技术能力的缺乏。
  • 监控技术可能被执法部门滥用,导致对受害者的跟踪和骚扰。
  • Flock 的安全漏洞使得外界更容易质疑其声称的监控功能的可信度。
  • Flock 可能没有对其使用的硬件和软件进行有效的安全监控和管理。
  • 许多用户对 Flock 的监控系统表示反对,认为其数据安全性不足。
  • 存在对执法人员使用 Flock 系统的安全实践的担忧。
  • 有人指出,技术公司在满足合规性要求的同时,忽视了实际的安全性和隐私保护。

9. 为 M4 Mac Mini 构建 Linux GPU 驱动:一个月完成 (Building a Linux GPU Driver for the M4 Mac Mini in One Month) #

https://codyho.dev/blog/gpu-driver/

本文是 Cody Ho 的博客文章,讲述他与 Niklas 在一个月内从零构建了一款兼容 OpenGL ES 3.0 的 GPU 驱动,用于 M4 Mac Mini 和 MacBook Neo,并成功运行 WebGL 和 Minecraft(约 200 fps)。

项目背景:GPU 驱动开发通常需要数年,他们通过逆向工程 Apple AGX GPU 的固件 ABI 和用户态组件,大幅缩短了时间。整个过程采用“干净室”方法,仅基于硬件追踪和自建着色器,未查看 Apple 二进制文件。

技术实现分为两部分:

  • 内核空间:通过自定义 hypervisor 追踪 macOS 行为,逆向 RTKit 固件 ABI,并实现了完整的 Linux 内核驱动。
  • 用户空间:构建了完整的用户态驱动,包括自定义 IR/着色器编译器、命令流生成器等。

过程中遇到的主要挑战包括:固件启动后难以捕获干净状态、计算任务的追踪文件过大(336 MB)且难以重放,以及 A18 Pro 固件 ABI 比 M1/M2 复杂得多。最终通过禁用 GUI、在最早时机运行小型 Metal 程序等方式解决了问题。

作者还提到,代码尚未面向最终用户,但计划尽快发布。


HN 热度 407 points | 评论 258 comments | 作者:ADevWithAnIdea | 1 day ago #

https://news.ycombinator.com/item?id=49717638

  • 逆向苹果硬件驱动与破解廉价 4G 调制解调器无异,非驱动开发者能在几周内完成实属奇迹,应予以赞扬
  • 攻击花费个人时间和金钱让封闭硬件更可用、更注重隐私、减少电子垃圾的人是对人类未来的犯罪
  • AI 逆向工程是很好的起点,虽然不一定是生产就绪,但发布非生产就绪的东西是可以的,且能给出有意义的函数名便于验证
  • 应该赞扬所有尝试让设备在 Linux 上更可用的人,即使主要靠提示和测试,这也鼓舞人心
  • 没有官方规格、公司批准或长期支持计划的驱动能否被视为"生产就绪"存疑,关键问题在于能否合并到上游
  • 作者因在另一次贡献中隐瞒大量使用 LLM 以及隐瞒前苹果工程师身份而被 Asahi Linux 封禁
  • 作者否认隐瞒身份,称简历、LinkedIn、GitHub 都是公开的,且未接触过任何苹果内部信息
  • 作者在 Asahi IRC 上承认了解 SPTM 平台并认识相关工作人员,但解释称与那位朋友只在斯坦福见过一次面,从未讨论过 Apple Silicon 细节
  • 在科技行业待久了会认识很多知道秘密的人,仅与某人交谈不构成侵权证据
  • Asahi Linux 团队态度保守谨慎,作者对法律问题的轻率态度足以成为拒绝其贡献的理由
  • LLM 是否应被视为污染干净室的"有毒废物"尚无定论,作者显然不认为这是大问题
  • 如果苹果在其代码中识别出非开源代码,这将是一场混乱

10. 小众编程技巧 (Small programming tricks) #

https://will-keleher.com/posts/small-programming-tricks-matter/

这篇文章分享了一些能提升工程效率的小众编程技巧,强调“小而高杠杆”的知识往往比大而全的框架更有用。作者列举了多个实用例子:用 fzf 增强终端历史搜索、用 atuin 将 shell 历史存入 SQLite、数据库支持无 FROM 的 SELECT 和 EXPLAIN ANALYZE、正则中的 \b 词边界、用对数分桶统计指标分布、现代 JS 的 flatMap 和 Promise.withResolvers、Node.js 中复用 https.Agent 降低延迟、git log -S 用“pickaxe”搜索代码增删、git checkout - 回到上一个 HEAD、用 **/*.md 替代 find、推荐 ripgrep、以及 zsh 高级补全的配置方法。作者还建议在公司内部每天分享一个这类技巧,既能帮助他人,也可能引发有价值的讨论,并提到这一做法源自 Julia Evans 的博客理念。


HN 热度 368 points | 评论 178 comments | 作者:signa11 | 8 hours ago #

https://news.ycombinator.com/item?id=49729000

  • 技巧需要刻意练习和记录,比如写进文档、贴备忘单或打印放在显示器旁,甚至用键盘模板。
  • zsh 可配置历史搜索,输入前缀或子串后用上下箭头过滤历史;macOS 需手动添加 bindkey 启用。
  • atuin 能改善历史搜索体验,但有人觉得难用,开发者称已改进。
  • 通过观察 AI 工作(手动批准命令)可以学到新技巧。
  • 有人设置 bash 脚本在输入旧命令时"责骂"自己,以强制改用新命令。
  • 关于 git switch vs checkout 的讨论:有人觉得没必要切换,有人认为是 git 本身的问题。
  • 用 git lfs 同步个人笔记和备忘,简单可靠。
  • 热桌办公让贴备忘单的习惯消失,导致桌面焦虑。
  • 打印副本能建立空间关联,数字方案需要常驻显示器。
  • 让 AI 代理把备忘单编译成可搜索网站供个人参考。
  • 有人讽刺地建议用蓝牙传感器和机器人自动贴便签。

Hacker News 精彩评论及翻译 #

Tell the speakers that you liked their talks #

https://news.ycombinator.com/item?id=49728882

I once gave a short talk at Harvard. Nearly didn’t because I was so intimidated by the crowd. Got through it, hardly able to read the room because of my internal dialogue of focusing on the content, and also convinced I was a fraud. Then I realized I went over my time limit by almost 50%. When it was over, my emotions were such a mess I logically thought I should try to cry or scream to let off the overwhelming negative energy I had built up. It was one unreal bucket of feelings after another. As I collected my clip board and bag, I walked to the side of the hall where I was sure I had seen an exit, someone dodged in front of me and put their hand out and introduced themselves and started asking questions about the talk. Took her card and suddenly there was another. It wasn’t until maybe the fourth person when I realized there was a line of at least twenty people. Yeah, stop and say hi. Even with critical questions, complaints. Making a connection with other people is one of the most important things we can do.

ynac

我曾有一次在哈佛做简短演讲。差点没去成,因为我很怕那群人。最后还是挺过去了,但由于内心一直在专注内容,几乎无法读懂会场气氛,而且深信自己是个冒牌货。然后我意识到我超时了将近50%。结束后,我的情绪一片混乱,以至于逻辑上我认为应该试着哭出来或尖叫,以释放积累的压倒性负面能量。那真是一波又一波不真实的感受。当我收拾好我的夹板和手提包,走向大厅旁边我确信见过的出口时,有人闪到我面前,伸出手自我介绍,并开始询问有关演讲的问题。收下她的名片后,突然又有一个人。直到大概是第四个人的时候,我才意识到有一排至少二十人的队伍。是的,停下来打个招呼吧。即使面对质疑和抱怨,与他人建立联系也是我们能做的最重要的事情之一。


Building a Linux GPU Driver for the M4 Mac Mini in… #

https://news.ycombinator.com/item?id=49720236

concealing that he is a former Apple engineer with direct contacts to the people involved in Apple Silicon development

This is false. I am a former Apple engineer. I did not conceal it (it’s the top item of my resume and my LinkedIn and I made my PR from my public Github with my name attached, as opposed to a pseudonym which is expressly allowed by Asahi policy). I also had no exposure, at all, to any internal information or code about macOS, SPTM, or Apple Silicon during my time there.

I also don’t have connections to people involved in Apple Silicon development (and I’d add that this does not mean someone cannot contribute, the question is were they exposed to tainted information, which is absolutely not true in my case). I have many friends who work for Apple (I’m a Stanford alum) but none in Apple Silicon directly.

I disagree with the phrasing of this entire thing, but this statement is demonstrably false.

ADevWithAnIdea

隐瞒他曾是苹果工程师、且与Apple Silicon开发相关人员有直接联系一事

这是假的。我确实是前苹果工程师。我没有隐瞒这一点(这是我简历和LinkedIn上的第一项,而且我是用附有我名字的公开GitHub发起PR的,而不是用Asahi政策明确允许的化名)。而且我在苹果期间,完全没有接触过任何关于macOS、SPTM或Apple Silicon的内部信息或代码。

我也不认识参与Apple Silicon开发的人(我想补充一点,这并不意味着别人不能做出贡献,问题在于他们是否接触过被污染的信息,而对我来说这绝对不成立)。我有很多朋友在苹果工作(我是斯坦福校友),但没有一个人直接从事Apple Silicon相关工作。

我不同意这整段话的措辞,但这句话被证明是假的。


EU chief opens door for Canada to become ‘associat… #

https://news.ycombinator.com/item?id=49724999

Carney was asking for freedom of movement of goods, people and services, but without full monetary and legislative integration.

So, easier to sell stuff, easier to buy stuff, free to just travel to/from Canada/EU and work there with no extra paperwork, free to buy and sell service from Canada to EU and vice versa.

No Euro, no vote in EU, no ECJ, no payments into each others budget.

Tighter integration than UK, not as tight as Norway/Switzerland/Iceland.

Common defense was already agreed anyhow.

I can tell you this enjoys broad support in the EU public. Although, no joke, a lot of peoples first reaction is: “They need to compete in Eurovision first. Otherwise they should wait for Australia to join first.”

FabCH

卡尼想要的是商品、人员和服务的自由流动,但没有完全的货币和立法一体化。

也就是说,卖东西更容易,买东西更容易,自由往返加拿大和欧盟并在那里工作而无需额外手续,自由在加拿大和欧盟之间买卖服务。

没有欧元,没有欧盟投票权,没有欧洲法院,不向对方预算缴款。

一体化程度比英国更紧密,但不如挪威/瑞士/冰岛紧密。

共同防御反正已经达成一致了。

我可以告诉你,这在欧盟公众中享有广泛支持。不过,说真的,很多人的第一反应是:“他们得先参加欧洲歌唱大赛。否则他们应该等澳大利亚先加入。”


Introducing System One Models and Jev #

https://news.ycombinator.com/item?id=49718492

First, congrats to the team on launching something genuinely interesting and new.

Seems like a more accurate title would be “Jev: Trading general purpose generation for fast typed inference” or something like that.

This is interesting, but the speed comparison seems misleading? A generative model that can output code in a Turing-complete language can do anything a computer can do.

Jev can only generate structured output, right? This is probably super useful for classification/routing/scoring, but it’s nothing like the code generating models we’re all using today for code and automation.

Also “can’t hallucinate” seems wrong? Sure, it can’t emit an invalid type, but it can still emit a completely wrong valid value. You can enforce structured output from an LLM too, with an appropriate harness, etc.

Assuming there’s no funny business, the Doom demo is cool.

jacobgold

首先,恭喜团队推出了一些真正有趣且新颖的东西。

似乎更准确的标题应该是“Jev:用通用生成换取快速类型化推理”之类的。

这很有趣,但速度比较似乎有误导性?一个能够用图灵完备语言输出代码的生成模型,可以做到计算机能做的任何事情。

Jev只能生成结构化输出,对吧?这可能对分类/路由/评分非常有用,但它和我们今天用于代码和自动化的代码生成模型完全不是一回事。

另外,“不会产生幻觉”这种说法似乎不对?诚然,它不能输出无效类型,但它仍然可以输出一个完全错误但有效的值。你也可以通过适当的框架等方式,让LLM强制生成结构化输出。

假设没有猫腻,那个Doom演示很酷。


Gemini 3.8 Live and 3.8 Live Extended Thinking #

https://news.ycombinator.com/item?id=49718996

My first language is Afrikaans, which is a somewhat niche language and hard to find teachers/conversation buddies outside South Africa. (I live in USA now)

I’ve been using Gemini to live chat in Afrikaans and do impromptu Afrikaans grammar lessons during my solo drives around town. It is phenomenal at speaking the language - like, it really shocks my family members when they hear it.

This is probably the most joy I get from any of my usages of LLMs/AIs. It’s been really, really nice getting to speak my language regularly again. =)

So, I’m excited about this release and live chat getting better. I also hope the other frontier labs pick up niche languages like this as well so that I have more options.

jeanbza

我的母语是南非荷兰语,这是一种比较小众的语言,在南非以外很难找到老师或练习对话的伙伴。(我现在住在美国。)

我一直在用Gemini在开车到处跑的时候用南非荷兰语实时聊天,还临时进行南非荷兰语语法课。它说这种语言的能力非常惊人——真的,我的家人听到时都很震惊。

这可能是我使用所有大语言模型/人工智能时获得最多乐趣的一项功能。能重新经常说自己的语言,真的、真的非常棒。=)

所以,我对这次发布和实时聊天的改进感到兴奋。我也希望其他前沿实验室也能支持这样的小众语言,这样我就有更多选择了。


Show HN: An e-ink frame that hears birds and draws… #

https://news.ycombinator.com/item?id=49717700

This is the coolest thing on HN that I’ve seen in a minute. The whole thing is a perfect blend of ideas with the end result of something that feels… magical. Honestly this is the highest inspiration to me as a builder as I just want to create magical experiences, even if they are just small oddities.

jadbox

这是我在HN上这阵子见过最酷的东西。整个作品完美融合了各种想法,最终呈现出一种……奇妙的感觉。老实说,这对我这个创作者来说是最大的启发,因为我就想创造奇妙的体验,哪怕只是些古怪的小东西。


Why I’m still bearish on LLMs after Navier-Stokes #

https://news.ycombinator.com/item?id=49720191

This April 2026 paper is a fun and related read.

https://arxiv.org/html/2509.24239v4

Researchers asked frontier models to play chess. Have a look at the MAR rates in Table 3. When not explicitly told which moves were legal, no model identified legal moves at a rate better than 80%. Many asked for more illegal moves than legal moves. And even when explicitly told which moves were legal, the models continued to ask for illegal moves. With illegal asks discarded, none of the bots could beat a chess model calibrated to 1100 ELO.

The author of the originating post says that “current frontier models need laborious oversight and guardrails on even the simplest tasks”, and he’s absolutely correct.

carodgers

这份2026年4月的论文读起来很有趣,也与此相关。

https://arxiv.org/html/2509.24239v4

研究人员让前沿模型下棋。看看表3中的MAR比率。在没有明确告知哪些走法合法时,没有模型识别合法走法的比率超过80%。许多模型要求非法走法的次数多于合法走法。即使明确告知哪些走法合法,模型仍会继续要求非法走法。剔除非法要求后,没有一个机器人能击败校准到1100 ELO的象棋模型。

原帖作者表示“当前的前沿模型即使在最简单的任务上也需要繁重的监督和护栏”,他完全正确。


Mistral X Mozilla: Private, Multilingual AI Browsi… #

https://news.ycombinator.com/item?id=49724318

This is an excellent use case for completely local, small model inference, yet for inexplicable reasons Mozilla wants to normalize uploading your entire private browsing history to a cloud.

These (Mistral’s and Mozilla’s) marketing pages aren’t candid enough to clearly explain the difference between local and cloud inference, and that they’re asking you to consent to enabling the latter. I’d call that the bare minimum of ethics. If you’re in a position of authority over your less technical users, you are ethically obligated to give them the full picture of what are you doing and why they should consent.

(Aside to any Mozilla people who might be reading HN, your page here[0] has an oversight, it advertises this model as “Mistral Small 4” but the hyperlink is to OpenAI’s model card for gpt-oss-120b).

[0] https://support.mozilla.org/en-US/kb/smart-window-models

peri-cl

这是完全本地化、小型模型推理的绝佳用例,然而令人费解的是,Mozilla 却想将你的完整私人浏览历史上传到云端并使之常态化。

这些(Mistral 和 Mozilla 的)营销页面不够坦诚,没有清楚说明本地推理与云端推理之间的区别,也没有说明他们是在请求你同意启用后者。我认为那是最起码的伦理底线。如果你对技术水平较低的用户拥有权威地位,你在伦理上有义务让他们全面了解你在做什么,以及他们为什么应该同意。

(顺便对任何可能正在阅读 HN 的 Mozilla 人员说一句,你们这里的页面[0]有个疏忽:它把这套模型宣传为“Mistral Small 4”,但超链接指向的却是 OpenAI 的 gpt-oss-120b 模型卡。)

[0] https://support.mozilla.org/en-US/kb/smart-window-models


PS5 Linux lead quits: “a bunch of noobs using LLMs… #

https://news.ycombinator.com/item?id=49728206

Hobby groups projects like this are less fun for a lot of people who used to enjoy interacting with smart people. It’s definitely become a game of just spam claude for answers with zero understanding or care for how anything actually works. That’s fine to get things done and fine for a lot of side projects, but it definitely ruins the joy that people have in understanding systems and working with intellectuals.

eugenekolo

像这样的爱好者团体项目,对很多过去喜欢和聪明人交流的人来说,乐趣变少了。这确实变成了一场游戏:只是一味地向Claude要答案,对所涉及的东西如何运作毫无理解也不在意。用来完成任务、做很多副业项目确实没问题,但它无疑毁掉了人们理解系统以及和知识分子共事的那种乐趣。


The Google Play app review process now regularly t… #

https://news.ycombinator.com/item?id=49725718

MAYBE operating systems shouldn’t have gatekeepers which can deny access to billions of customers for any and no reason at all. Apple and Google are WELL past due for regulation in this space. The fact that we cannot download and install software from the internet onto our phones JUST like we can do with our computers is a symbol of our inept and ineffective politicians.

And before someone says “well akshully you can technically do it on Android,” Google has been working tirelessly to make it as onerous as possible for both developers and customers. For example, users need to separately authorise each app (browser, files manager, alternative store, etc) to install an APK from outside the Play Store. Google also does background scans using “Play Protect” which will periodically delete apps Google doesn’t approve of. This happened to me with SmartTubeNext. I have a dozen other ways Google ensures users are discouraged from stepping outside the Play Store.

Gareth321

也许操作系统不应该有守门人,可以无缘无故地拒绝数十亿用户访问。苹果和谷歌在这个领域的监管早该到位了。我们无法像在电脑上那样从互联网下载并安装软件到手机上,这一事实正是我们政客无能和低效的象征。

在有人说“其实吧,安卓上技术上是可以做到的”之前,我要说,谷歌一直在不遗余力地让开发者和用户都尽可能难以上手。例如,用户需要分别授权每个应用(浏览器、文件管理器、替代应用商店等)才能从Play商店之外安装APK。谷歌还会用“Play Protect”进行后台扫描,定期删除谷歌不认可的应用。我就遇到了这种情况,比如SmartTubeNext。谷歌还有十几种其他方式确保用户被劝退,不敢走出Play商店。


Why I’m still bearish on LLMs after Navier-Stokes #

https://news.ycombinator.com/item?id=49720560

I know HN readers and posters just read numbers and can’t be bothered to read, but please read the methodology before making any claims.

About their ELO ratings from their own website:

A field-relative rating calculated within ChessBench. It compares performance among the tested models and is not a direct equivalent of a human chess rating.

I am around 1600 elo in over the board I can mop up Astra Fable etc even if I give them literal infinite time and all the subagents and internet access..

Please folks at least use your AIs to read stuff before making claims.

AI is not GM level, it’s not even 1600, I am 1600 by using memorized openings people frequently fall for with very basic intuitions.

A GM is 2600 they can beat me in under 20 moves…

Why do I even scroll through this website. For a moment I truly felt fooled, but then I read like a human should.

Maybe I should stop doing that will be a happier life, don’t think just believe in the AGI.

minraws

我知道HN的读者和发帖者只看数字,不愿费心去读,但请在做出任何断言之前先读读方法论。

关于他们自己网站上的ELO等级: 这是在ChessBench内部计算的一个领域相对等级。它用于比较受测模型之间的表现,并非人类国际象棋等级的直接等价物。

我的线下对弈等级约为1600 elo,即使给Astra、Fable等模型真正无限的时间,以及所有子代理和互联网访问权限,我也能轻松收拾它们。

拜托,各位,在做出断言之前,至少用你们的AI去读读材料。

AI不是特级大师水平,甚至不到1600。我之所以有1600,是靠记忆开局套路和非常基本的直觉,而这些套路人们经常会上当。

特级大师的等级是2600,他们不到20步就能击败我……

我到底为什么要浏览这个网站。有那么一刻我真的觉得自己被愚弄了,但后来我像人类应该做的那样去阅读了。

也许我该停止这么做了,那样生活会更幸福,别思考,只要相信AGI。


EU chief opens door for Canada to become ‘associat… #

https://news.ycombinator.com/item?id=49724891

No idea what this actually means, if it means easier trade, I’m all for anything that reduces our dependency on the yanks, as long as we don’t need to be involved in their regulatory or legal regimes. The Americans are no longer our friends, Salut, mes amis Européens. :)

neom

完全不知道这到底意味着什么,如果这意味着更容易的贸易,那我完全支持任何减少我们对美国人依赖的事情,只要我们不需要卷入他们的监管或法律体系。美国人不再是我们朋友了,再见,我的欧洲朋友们。:)


Show HN: An e-ink frame that hears birds and draws… #

https://news.ycombinator.com/item?id=49715349

The underlying classifier, BirdNET, is a traditional neural network and not an LLM:

https://doi.org/10.1016/j.ecoinf.2021.101236

divbzero

底层分类器BirdNET是一个传统神经网络,而非大语言模型:

https://doi.org/10.1016/j.ecoinf.2021.101236


Introducing System One Models and Jev #

https://news.ycombinator.com/item?id=49721150

Wasn’t really till seeing this home assistant demo they have ( https://www.loom.com/share/18c4dbcf8db546dfb2d7f2ef018e78e4 ) that the value really clicked for me.

Seems really cool.

cfowles

直到看到他们这个智能家居演示(https://www.loom.com/share/18c4dbcf8db546dfb2d7f2ef018e78e4),我才真正理解了它的价值所在。

看起来真的很酷。


Apple Reference Image: A New Approach for Verified… #

https://news.ycombinator.com/item?id=49722362

This is really clever from Apple. The journalist use case is just the PR story. This will be really useful for identity verification and insurance apps, and has the potential to shift from “you need a smartphone to be able to live normally” to “you need an iPhone to be able to live normally”.

There are already plenty of insurances that require you to submit claims through a smartphone app that tries to essentially do this by capturing sensor metadata etc. - those don’t need to be nation-state resilient, just Joe the Crackhead Insurance Scammer resilient, so this works. Likewise, more and more things online require identity verification (either officially or disguised as age verification).

Edit: And while “a nation state actor can spoof this” is a problem for the journalism use case, the insurance/ID verification use cases are perfectly fine with anything that raises the bar but could be bypassed with enough effort. Also, the journalism use case suffers from the same fundamental issue all of these use cases suffer from: People will “verify” the picture by looking at the repost of a screenshot of the verification UI, not by verifying the original themselves.

tgsovlerkhgsel

苹果这招确实高明。记者用例只是公关话术。这在身份验证和保险应用上会非常实用,有可能从“你需要智能手机才能正常生活”变成“你需要iPhone才能正常生活”。

已经有很多保险要求你通过智能手机应用提交理赔,这些应用本质上就是通过采集传感器元数据等来做这件事——它们不需要抵御国家级对手,只要能防住“乔那个吸毒的保险诈骗犯”这种级别就够了,所以这个方案可行。同样,越来越多线上事务需要身份验证(要么是官方的,要么是打着年龄验证旗号的)。

补充:虽然“国家级行为者可以伪造这个”对记者用例来说是个问题,但保险/身份验证用例完全没问题,只要能提高门槛、即使花大力气仍可能被绕过也没关系。另外,记者用例也面临所有这些用例共有的根本问题:人们会通过看验证界面截图的转发来“验证”照片,而不是自己去验证原始文件。


Why I’m still bearish on LLMs after Navier-Stokes #

https://news.ycombinator.com/item?id=49720313

current frontier models

Gemini 2.5 Pro, O3, Claude Sonnet 3.7 and ChatGPT 4.1

The gap in capabilities between those models which they tested, and actual current frontier ones is enormous. I would not trust that any conclusions they made are applicable.

joefourier

当前前沿模型

Gemini 2.5 Pro、O3、Claude Sonnet 3.7 和 ChatGPT 4.1

他们测试的那些模型与实际当前前沿模型之间的能力差距巨大。我不认为他们得出的任何结论具有适用性。


25 years of mass surveillance is enough #

https://news.ycombinator.com/item?id=49711918

Surveillance and totalitarian control is a downward spiral of misery and suffering for everyone, even those in power.

It reminds me of some quotes from the Tao Te Ching -

Restriction breeds the disorder it’s meant to prevent (ch. 57) The more prohibitions there are in the world, the poorer the people become. The more sharp weapons, the more the state falls into confusion. The more laws and edicts are posted, the more thieves and bandits there are.

The world isn’t a thing to be managed (ch. 29) The world is a sacred vessel; it cannot be manipulated. Whoever acts on it ruins it; whoever grips it loses it.

N_Lens

监视和极权控制对每个人来说都是痛苦与苦难的恶性循环,甚至对当权者也是如此。

这让我想起《道德经》中的一些话——

限制滋生它本要防止的混乱(第57章):天下的禁令越多,民众就越贫穷;锋利的武器越多,国家就越混乱;颁布的法令越多,盗贼就越层出不穷。

世界不是一件可以管理的事物(第29章):世界是神圣的器皿,不可被操纵。谁去强为,谁就毁掉它;谁去紧握,谁就失去它。


An update on Wayback Machine access #

https://news.ycombinator.com/item?id=49717583

Mad props to the people at the Archive. You are the heros we need in a formerly open internet that is surrendering to evil big corps and closing down free access.

The Internet Archive is in a really bad spot being attacked from multiple sides at once. But — while service has not been consistent — they have maintained open access. I can still access anonymously from Tor without Cloudflare or some other centralized gatekeeper showing me the middle finger.

If you got some money to spare, consider donating to them. They need it.

basilikum

向互联网档案馆的人们致敬。在曾经开放的互联网正屈服于邪恶大公司、关闭免费访问的当下,你们是我们需要的英雄。

互联网档案馆正身处困境,同时遭到多方攻击。但尽管服务时好时坏,他们始终维持着开放访问。我依然能通过Tor匿名访问,不会被Cloudflare或其他集中式守门人拒之门外。

如果你有余钱,考虑捐给他们吧。他们需要支持。


Building a Linux GPU Driver for the M4 Mac Mini in… #

https://news.ycombinator.com/item?id=49721566

Dear fellow humans from “Hacker News”. Hacking a driver that in itself documentation to black box Apple hardware is not any different from hacking $10 4G LTE modem.

Fact that a person who was not previously driver developer can achieve this in a few weeks is pure wonder. No matter what tools are used.

Leave legal questions to Linux Foundation laywers or whoever is responsible to accept or not accept the patches.

If Apple actually wanted to prevent any of this from happening they can just lock bootloader. They not just gonna do it now because someone used fancy text generator to make working GPU driver.

Attacking a person who spent their personal time and money on making walled garden black box hardware more usable, more privacy friendly and further away from landfill is a crime against the future of humanity.

SXX

来自“Hacker News”的人类朋友们,破解一个其文档本身就把苹果硬件视为黑盒的驱动程序,与破解一台10美元的4G LTE调制解调器并无本质区别。

一个此前并非驱动开发者的人能在几周内实现这一点,纯粹是奇迹。无论使用了什么工具。

把法律问题留给Linux基金会律师或任何负责决定是否接受补丁的人去处理吧。

如果苹果真想阻止这一切发生,他们只需锁定引导加载程序即可。他们现在不会这么做,仅仅是因为有人用花哨的文字生成器搞出了一个可用的GPU驱动。

攻击一个花费个人时间和金钱、让围墙花园里的黑盒硬件更可用、更注重隐私、更远离垃圾填埋场的人,是对人类未来的犯罪。


Ubuntu 26.10 completes transition to Rust-based co… #

https://news.ycombinator.com/item?id=49709415

but it segfaulted in a memory safe way.

monegator

但它以一种内存安全的方式段错误了。


An update on Wayback Machine access #

https://news.ycombinator.com/item?id=49717087

The links are usually to Archive.today (aka archive.ph and a bunch of other domains), not Wayback Machine (which is run by Internet Archive).

ValentineC

链接通常指向Archive.today(又名archive.ph以及其他一堆域名),而不是Wayback Machine(由互联网档案馆运营)。


Let’s make quality the norm again #

https://news.ycombinator.com/item?id=49710217

While it does relate to price discovery–i.e., some folks just aren’t willing to pay for an additional unit of quality at 10x–my theory is that the decline in quality is another hidden form of inflation. Thing continues to cost X even though regulations have increased costs Y, ship production to China and scrimp on the inputs. (Or have market forces do that for you.)

piker

虽然这确实与价格发现有关——也就是说,有些人就是不愿意为额外一单位的质量付10倍的价格——但我的理论是,质量下降是另一种隐藏的通货膨胀形式。尽管法规让成本增加了Y,把生产转移到中国,并在投入上偷工减料(或者让市场力量帮你做到这一点),这东西却仍然维持着X的价格。