2026 10 01 HackerNews

2026-10-01 Hacker News Top Stories #

  1. OpenAI发布GPT-6.1 Sol,性能接近GPT-6 Astra但价格仅为后者的五分之一,在编码、专业工作等基准测试中表现优异,事实性错误率降低约32%。
  2. livenerf是一个长期运行的基准测试项目,通过冻结提示词、固定CLI版本和永久保留原始日志来检测前沿模型发布后是否悄悄变差,目前正在跟踪Claude Opus 5.5的表现。
  3. OpenAI 发布了名为“dots”的智能体产品,定位为始终在线、能力强大的 AI 代理,由 GPT-6 Astra 驱动。
  4. Pi平台最初不支持MCP,但发现其核心需求与MCP相似后将其纳入核心功能,并介绍了Codemode机制以在更可信的环境中协调工具调用。
  5. 一位波兰作者以本国视角描绘2026年9月的全球多重危机:美以对伊朗开战后霍尔木兹海峡被封锁,布伦特原油升至每桶108美元,燃料、食品、供暖三条路径传导冲击,全球饥饿人口或新增4500万。
  6. 一个实时太空追踪与可视化网页展示地球轨道及太阳系内约19,890颗在轨卫星和837个太阳系天体的实时位置与轨道信息,支持拖拽旋转、滚轮缩放和点击查看天体信息。
  7. 美国佛蒙特州通过推广家用电池系统构建"虚拟电厂",已有超过5500户参与,聚合形成约110兆瓦的容量,相当于一座小型天然气发电厂,已成为该州最大电力来源。
  8. 中国AI实验室在推理优化方面的突破(如DeepSeek的MLA架构压缩KV缓存约15倍)被西方公司采用,Anthropic和OpenAI低调发布采用这些优化的新模型,缓存读取价格大幅下降60%-80%。
  9. Tcl/Tk 9.1.0发布,新增unicode命令、timer命令、lfilter命令等,支持无障碍屏幕阅读器、双向文本/RTL,新增ttk::toggleswitch小部件和tk attribtable命令。
  10. 美国邮政检查局联合联邦机构关闭了销售假邮资标签的网站 LabelsBank.com,并起诉其运营者。

1. GPT 6.1 Sol:以五分之一的价格提供接近 Astra 的智能水平(GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price) #

https://openai.com/index/introducing-gpt-6-1-sol/

OpenAI 发布了 GPT-6.1 Sol,这是 GPT-6 Sol 的升级版,在编码、专业工作、计算机使用、科学研究和事实性等方面均有显著提升,性能接近 GPT-6 Astra,但价格仅为后者的五分之一。

在多项基准测试中,GPT-6.1 Sol 表现优异:在 DeepSWE v1.1 编码测试中追平 Astra,成本约为其五分之一;在 GDP.pdf 专业文档问答中超过 Opus 5.5;在 AutomationBench 多步骤工作流测试中得分高于 Opus 5.5;在 OSWorld 2.0 计算机使用测试中比 GPT-6 Sol 提升 7 个百分点;在 Terminal-Bench Science 0.1 科学研究测试中得分翻倍以上。此外,其事实性错误率在低推理强度下比 GPT-6 Sol 降低约 32%。

安全方面,GPT-6.1 Sol 在透明度、遵循用户意图和安全约束方面均有改进,失败率更低。该模型即日起在 ChatGPT Work 和 Codex 中可用,开发者可通过 API(gpt-6.1-sol)访问,标准定价为输入每百万 token 2 美元、缓存输入 0.10 美元、输出 10 美元。未来几天还将推出生成速度提升 8 倍的 Ultrafast 版本。


HN 热度 1049 points | 评论 930 comments | 作者:crorella | 1 day ago #

https://news.ycombinator.com/item?id=49896586

  • 6.1-Sol 和 Astra 在编码评估中优于 Opus 5.5,且 API 价格更便宜,6.1-Sol 比 Sonnet 5.5 便宜且更聪明
  • GPT-6 模型"低主动性"是优点,不会过度发挥超出提示要求
  • GPT 在研究中表现懒惰,经常遗漏明显信息,需要多次要求重新检查
  • 缓存输入成本降至每百万 token 0.10 美元,比标准输入便宜 95%,比 GPT-6 Sol 便宜 50%,是重大卖点
  • Codex 中 token 消耗极快,频繁压缩上下文,$100 订阅很快用完
  • Astra 比 6.1 Sol 消耗快约 7 倍,Sol 几乎无限使用而 Astra 一天就用完
  • 使用量重置机制有问题:使用银行重置后每周额度减少约 80%,且重置日期不变
  • 有人反驳"使用方式不对"的指责,认为付费用户有权利抱怨产品问题
  • 上下文窗口 275k 太小,Claude 可支持到 700k,但 GPT 的 256k 上下文利用效率高于 Claude 的 1M
  • 提示词和任务定义是影响 LLM 性能的主要变量,不会用 LLM 的人容易浪费 token

2. Livenerf:Opus 5.5 是否已被削弱? (Livenerf: Has Opus 5.5 been nerfed yet?) #

https://github.com/ninjahawk/livenerf

livenerf 是一个长期运行的、尽可能确定性的基准测试项目,用于检测前沿模型在发布后是否悄悄变差。项目背景是:有传言称 Anthropic 会在模型发布数天或数周后“削弱”模型,但此前没有干净的 day-0 基线可供验证。Claude Opus 5.5 于 2026-09-22 发布,项目从发布当天开始计时并持续运行。当前 v0 版本通过无 API 密钥的 headless Claude Code(claude -p)在 Claude Max 订阅上运行。由于无法使模型完全确定性(采样参数不可用、思考无法关闭),项目通过冻结提示词、固定 CLI 版本、精确评分器和永久保留原始日志来保证其他环节的确定性,并基于 Inspect 框架和 Anthropic 的误差棒统计方法,对数千个样本进行统计漂移检测。

状态:系列正在运行中。第 1 天为 2026-09-24 22:10 UTC,即发布后约 2.5 天。每天运行一次,共 30 天:第 1-10 天为基线期,之后有两个 10 天窗口,首次可能判定时间约为 2026-10-24。第 20 天后出现第一行结果。面板已按预注册协议(v2)选择、确认、锁定并验证。截至 2026-09-30,已收集 7/30 天数据(基线 7/10),无遗漏,全部 7 天均在相同 harness 哈希和固定 CLI 版本下运行完整 90 个样本。第 5 天有一次预算保护被覆盖的情况(见偏差日志)。

面板构成:从 GPQA Diamond、MMLU-Pro、competition-math 和 AIME 2025-26 中筛选了 2,336 道题,每道题采样 4 次。Opus 5.5 首次尝试正确率约 93%,97% 的题目要么全对要么全错,78 道“有时对”的题目组成了最终面板。选择偏差已被测量:因“有时对”而被选中的题目在新鲜样本上的通过率从 54.7% 上升到 62.0%,功效计算使用了新鲜样本比率。

检测能力:每天运行一次完整面板,可检测每 10 天窗口约 7.5 个百分点的准确率变化,约占每周计划的 3.6%。验证(docs/VALIDATION.md)通过了预注册标准。降低推理努力在 token 数上比准确率更明显:低努力模式输出 token 减少 62%,准确率下降 8.3 ± 4.5 点;中等努力模式 token 减少 26%,准确率下降 4.2 ± 3.9 点。局限性:在 99% 置信度下,将 Opus 5 替换为 Opus 5.5 无法被区分(-3.8 ± 6.3 点,token 减少 23%)。该工具无法在验证样本量内检测同系列模型替换。10 天窗口的样本量约为其 2.5 倍,但尚未证明足够。

问题质量:对 78 道题(加上后来排除的 2 道)进行仅报告审计,发现 8 个答案键疑似错误,30 道题存在歧义。这符合强模型“有时对”的题目预期,未删除任何题目。预注册的敏感性分析会在不包含这些题目的情况下重新运行结果。服务路径:安全分类器有时会用 Opus 5 回答或拒绝生物和部分数学问题,这些样本会被拒绝并计数,相关问题会被排除。

结果:该仓库主要维护一个运行中的 10 天表格,展示 Opus 5.5 在面板上的表现。


HN 热度 879 points | 评论 374 comments | 作者:bryan0 | 1 day ago #

https://news.ycombinator.com/item?id=49901736

  • 有专门的 Nerf Bench 在发布日测试模型,偏差超 10% 视为削弱,曾检测出 Opus 4.6 退化,目前跟踪 Opus 5.5 和 GPT-6 Astra。
  • 用户感知到的削弱往往多于实际发生,可能源于蜜月效应或期望不断提高;即使堆栈完全不变,用户仍会抱怨模型被削弱。
  • 用跑鞋类比:每年新款都被抱怨不如旧款,但实际只是少数不满用户发声,沉默多数满意;新鞋感觉更软是因为旧鞋泡沫老化。
  • 产品质量缩水是普遍现象(如缩水式通胀、skimpflation),公司可能逐步降低质量,用户对小幅下降不敏感,但大幅下降会被察觉;有观点认为公司不削减成本/质量会面临股东诉讼压力,但此类诉讼是否常见存疑。
  • 游戏行业也存在类似的质量下降问题。
  • 有用户对 Claude 整体满意,但"Claudish"风格曾让其想转向 OpenAI,5.5 版本留住了他。
  • 具体产品案例:ASICS Cumulus 系列曾发生重大设计变化,宜家 Billy 书柜后期用料变差,Amazon Basics 光纤曾直接发 Corning 原厂货,其镍氢电池曾与 Eneloop 相当但后来质量下降。

3. Dots: 始终在线的智能体 (Dots: Always-on agents) #

https://openai.com/index/introducing-dots/

OpenAI 发布了名为“dots”的智能体产品,定位为始终在线、能力强大的 AI 代理,由 GPT-6 Astra 驱动。每个 dot 拥有独立的云计算机,可连接超过 4000 个应用,并能通过 ChatGPT、Slack、Teams 等渠道与用户交互。

dots 可以独立完成复杂任务,自动学习用户的偏好、思维方式和质量标准,主动处理工作并在需要时请求批准。用户可通过活动视图监督其工作,并设置访问权限、自定义规则和内置安全防护。dots 支持连接用户自己的电脑,也可调用其他设备。

实际应用场景包括:开发者让 dot 监控反馈、修复 bug 并提交完整 PR;产品负责人让 dot 根据范围变化调整发布材料;科学家让 dot 更新数据分析;销售负责人让 dot 跟进合同与测试;内容创作者让 dot 剪辑片段、撰写帖子。

目前 dots 已开始向 Pro、Business Premium 和 Enterprise 用户逐步推出,并计划推出面向企业内部的专业版 dots,支持身份管理、深层系统集成和 IT 配置。


HN 热度 748 points | 评论 629 comments | 作者:alvis | 1 day ago #

https://news.ycombinator.com/item?id=49896604

  • 始终在线的智能体协作很有价值,能实现领域专家分工且不超载上下文窗口
  • 领域专属智能体能建立良好信任边界,避免个人与业务信息混杂
  • 结合云端智能体对开发很强大,解决了多工作流并行问题,但端到端速度较慢且推理开销增加 2-3 倍
  • 有人自建了类似系统:两个"AI 员工"常驻运行,负责客服工单、缺陷分类、编码调试、服务器监控和发布流程
  • 无法相信没有人工严格监督就信任 AI 做任何事
  • 两年前 AI 需要 99.8% 的监督,但人类同样需要监督,AI 的监督成本正接近甚至低于人类员工
  • 把 AI 当作需要管理的员工而非确定性软件,能得到更好效果——AI 和人类一样会分心犯错
  • 可以用两个不同模型互相验证或批评来提升可信度,但越狱问题仍令人担忧
  • 即使人在监督,使用 AI 输出本身就是在被 AI 引导,AI 实际上已在指导人类行动
  • 信任是逐步挣来的:从最小权限开始,反复检查无误后再逐步放手,AI 并不比人类员工更容易出错
  • 可以轻松指示智能体只做调查和方案提议,交由人类审查后执行

4. 你说没有 MCP (You said no MCP) #

https://earendil.com/posts/you-said-no-mcp/

这篇文章讨论了 Pi 平台现在支持 MCP(多种计算工具协议)的原因,以及这一改变背后的思考过程和技术细节。

首先,文章指出过去 Pi 明确表示不支持 MCP,但随着时间的推移,MCP 发生了变化,Pi 团队也开始重新考虑这个决策。虽然 MCP 的某些方面仍存在问题,例如组合性差,但团队认为其核心需求与 Pi 的需求相似,都是需要一个可以进行操作的沙箱环境,因此决定将 MCP 纳入核心功能。

接下来,文章分析了 MCP 的变化,不仅是 MCP 本身的改进,还包括 Pi 为支持 MCP 所做的调整。Pi 的扩展生态系统使得 MCP 本可以作为一个扩展功能存在,但最终选择将其集成到核心功能中,是因为这样能够促进对工具的更好管理和使用。

文章还提到,MCP 的核心问题在于许多 MCP 服务器仍然依赖于低效的工具返回格式,缺乏结构化的数据返回和文档描述的智能发现。Pi 团队希望通过将 MCP 与现代大语言模型(LLM)结合,来解决这些问题。

接下来,文章介绍了 Codemode 的概念。Codemode 是一种机制,能够在更可信的环境中协调和执行工具调用。与传统的 MCP 扩展不同,Codemode 运行在 “工具执行环境” 中,允许使用 JavaScript 来组合工具调用并灵活控制执行顺序。这种方式不仅提高了工具调用的效率,还能够保持会话状态。

最后,文章通过一个例子展示了 Codemode 的应用场景,例如在使用某个提供商的 “Jev” 功能时,可以在 Pi 中执行复杂的分析任务,从而优化工具的使用。文章总结道,Pi 团队将继续关注 MCP 和 Codemode 的未来发展,以适应不断变化的技术。


HN 热度 606 points | 评论 336 comments | 作者:yarapavan | 15 hours ago #

https://news.ycombinator.com/item?id=49906637

  • MCP 在 macOS 应用中可用自然语言配置,比从零编码更可靠
  • 给 Claude API key 即可控制 Home Assistant,无需 MCP
  • MCP 能节省 token,因为可以精确修改而非发送整个 YAML
  • MCP 主要价值在于安全,避免 agent 直接接触 API key
  • 安全优势可通过 API 层或代理实现,MCP 并非必需
  • 将 API key 放在 MCP 服务器并最小权限,用 Tailscale 保护
  • agent 不直接认证,由 harness 处理
  • 用不同 key,MCP 服务器限于本地网络
  • 给 key 即可,否则给另一个 MCP
  • Claude 让 HA 配置更简单,无需学习
  • MCP 不需要强大模型,本地 Qwen 即可,但复杂任务需要 Claude
  • MCP 是否有用取决于模型能力提升?
  • 提供 API key 和文档,用户用文本交互,llm.txt 包含指令
  • 想重新用 HA,agent 可减少复杂性
  • Claude 开发 HA 很好,能自然语言改配置

5. 2026 年 9 月:一个波兰人眼中的今日世界 (September 2026: The world today, as seen by one Polish guy) #

https://tomwojcik.com/posts/2026-09-21/september-2026-the-world-today/

2026 年 9 月,一位波兰作者以本国视角撰文,描绘了全球多重危机相互交织的图景。文章核心是:自 2026 年 2 月底美以对伊朗开战后,伊朗于 3 月起封锁霍尔木兹海峡,导致全球石油供应遭遇史上最大中断,布伦特原油在 9 月 24 日触及每桶 108 美元。这一事件通过燃料、食品和供暖三条路径传导至全球。

文章指出,俄乌冲突中乌克兰无人机频繁袭击俄炼油厂,推高美国柴油价格;法国因价格上限机制失效,约 15% 的加油站断供;化肥短缺将导致 2026 至 2027 年粮食减产,全球饥饿人口可能新增 4500 万。欧洲马铃薯因种植面积减少和干旱歉收 25%,比利时加工用马铃薯价格从每吨 10 欧元飙升至 150 欧元。

作者强调,世界并非走向终结,但过去三十年各国用依赖替代缓冲——用供应商替代储备、用保证替代军队——当多个依赖同时失效时,危机便叠加爆发。文章以“一个波兰人眼中的世界”为视角,串联起从波斯湾到欧洲农田、从油轮运费暴涨 2300% 到本国冬季供暖的完整因果链,揭示地缘政治、能源、粮食与金融市场的深度互联。


HN 热度 486 points | 评论 362 comments | 作者:marjancek | 17 hours ago #

https://news.ycombinator.com/item?id=49905487

  • 许多波兰人认为当前是波兰“黄金时代”:经济繁荣、安全、基础设施改善,远超历史任何时期。
  • 有人批评文章过度悲观,乌克兰战争证明俄罗斯虚弱,能源冲击加速可再生能源转型。
  • 讨论伊朗与霍尔木兹海峡冲突:有人认为美国卷入是战略失误,伊朗控制海峡对全球能源造成持续压力。
  • 美国石油公司短期获利巨大,但长期可能加速全球摆脱石油依赖。
  • 有人指出波兰公共部门(法院、军队)仍显过时与腐败,与私营部门的现代化形成鲜明对比。
  • 历史创伤(苏联时期短缺、战争)让东欧人更易悲观,而西方人有强烈正常化偏见。
  • 部分人担忧俄罗斯无人机已进入东欧,美国放松制裁,暗示风险仍在上升。
  • 整体上,帖子引发乐观与悲观的对立:本地生活改善 vs 全球地缘政治动荡,多数人承认风险真实但不必恐慌。

6. 展示 HN:实时太阳系——包含 52.6 万颗小行星及所有追踪到的卫星 (Show HN: Real-time Solar System with 526k asteroids and all tracked satellites) #

https://space.bl2.net/

这是一个实时太空追踪与可视化网页,展示地球轨道及太阳系内各类天体的实时位置与轨道信息。

页面核心内容:

  • 实时追踪约 19,890 颗在轨卫星,以及 837 个太阳系天体
  • 数据来源包括 CelesTrak 和 SatNOGS 数据库,更新于 2026 年 9 月 30 日
  • 可视化范围涵盖地球、太阳系行星及其卫星、矮行星、小行星、彗星、柯伊伯带、奥尔特云等

主要分类:

  • 行星与卫星:包括地球、火星、木星、土星、天王星、海王星等及其卫星
  • 小行星与彗星:已知小行星(如阿波菲斯、贝努)、605 颗彗星、星际访客(奥陌陌、鲍里索夫等)
  • 卫星与航天器:包括星链(11,127 颗)、OneWeb、千帆星座、GPS/北斗等导航卫星、地球静止轨道卫星、气象卫星等
  • 空间碎片:包括风云一号 C 碎片、宇宙 2251 与铱星 33 碰撞碎片等

交互功能:

  • 拖拽旋转、滚轮缩放、点击查看天体信息与轨道
  • WASD 飞行、R/F 升降、Q/E 转向,Shift 加速
  • 可切换时间流速(1 秒/秒),支持实时或自定义时间
  • 图层管理:按组显示/隐藏轨道,点击组名高亮

页面还显示小行星数据加载进度(20.8/29.5 MB,70%),以及当前 UTC 时间(2026-10-01 00:38:50)。


HN 热度 377 points | 评论 104 comments | 作者:wanick | 1 day ago #

https://news.ycombinator.com/item?id=49898778

  • 渲染用 WebGL2,轨道推算在 web workers 中运行,性能出色,普通笔记本也能流畅处理数十万对象。
  • 用户赞叹小行星带真实密度可视化、地球周围卫星密度(尤其 Starlink 占比极高),以及时间滑块前后回溯功能。
  • 有人指出卫星点并非真实尺寸(否则几乎看不见),作者已澄清距离成比例、点大小不成比例。
  • 讨论近地小行星监测进展:NEO Surveyor、DART 任务、Vera C. Rubin 天文台等将提升预警能力。
  • 有人对比 Celestia 等旧软件,但肯定本项目在浏览器端实时、卫星覆盖上的独特价值。
  • 用户建议增加 VR 支持、更快缩放、移动端优化、环境音效模式,作者已响应部分改进。
  • 有人感叹空间越来越拥挤,Starlink 占活跃卫星约 2/3 到 3/4,并讨论 Kessler 综合征风险(低轨因大气阻力风险较低)。
  • 整体评价极高:可视化精美、性能惊人、教育意义强,适合探索轨道力学与太空现状。

7. 佛蒙特州用家用电池替代发电厂 (Vermont replacing power plants with home batteries) #

https://www.bbc.com/future/article/20260928-a-virtual-power-plant-hidden-in-vermont-homes-is-keeping-the-lights-on-during-storms

美国佛蒙特州正通过推广家用电池系统构建“虚拟电厂”,以替代传统发电厂。该州最大电力公司 Green Mountain Power(GMP)推出项目,为居民安装家用电池,每月支付 55 美元、租期 10 年。已有超过 5500 户参与,这些电池聚合起来形成约 110 兆瓦的虚拟电厂,相当于一座小型天然气发电厂,已成为该州最大电力来源。

文章讲述了居民 Pollyanna Bladyka 的经历。她因频繁遭遇风暴导致的停电,原本打算购买 1.2 万美元的燃气发电机,后来选择租赁电池系统,自安装后再未停电。另一居民 Megan Browning 也安装了太阳能和两块电池,在附近邻居停电时她家毫无影响。

虚拟电厂将千家万户的电池、太阳能、智能恒温器等设备聚合调度,既保障家庭供电,又减少对化石燃料电厂的需求。美国目前虚拟电厂容量已超 40 吉瓦,预计 2030 年可达 160 吉瓦。佛蒙特州因极端天气增多、停电加剧,GMP 计划到 2030 年消除所有停电,甚至考虑为部分农村客户免费安装电池。


HN 热度 374 points | 评论 275 comments | 作者:devonnull | 1 day ago #

https://news.ycombinator.com/item?id=49897993

  • 美国北卡州公用事业公司推出虚拟发电厂计划,每月支付约 50 美元/电池,每年最多 36 次在用电高峰时段远程控制电池放电,与太阳能配合经济上很划算
  • 理想状态下电池电量应保持在 50%-80% 之间,36 次/年的控制权限仅用于主要峰值事件,希望未来家庭电池足够多,让可再生能源能数月不用化石燃料
  • 电池可设置最低电量(如 20%)来应对短期停电,也可选择退出有限次数的虚拟发电厂活动
  • 有峰值电价的地区,可配置电池在非峰值时段充电(如中午充到 90%),峰值时段(下午 1-7 点)完全不用电网电力,有天气预警时充满到 100%
  • 电池不能完全替代发电机,但结合屋顶太阳能可覆盖大多数停电场景;发电机适合长时间停电,而电池加太阳能相当于免费燃料
  • 如果必须二选一,优先选电池,因为电池覆盖多数停电且提供其他收益;两者兼有最佳
  • 电池能否替代发电机取决于储能容量和停电时长,若太阳能不足或需防御多日停电,化石发电机仍是必要补充
  • 不装太阳能也可行,电池可仅用于时间转移:低价时段充电、高峰时段放电,降低电费
  • 有社区太阳能项目可考虑,如佛蒙特州已立法允许阳台太阳能

8. AI 竞赛刚刚变得尴尬 (The AI Race Just Got Awkward) #

https://insufferable.dev/posts/the-ai-race-just-got-awkward/

这篇文章讨论了中国 AI 实验室在推理优化方面的突破如何被西方公司采用。核心内容包括:

DeepSeek 率先发布了 MLA 架构,将 KV 缓存压缩约 15 倍,随后又推出压缩稀疏注意力(CSA)和重度压缩注意力(HCA)。最新版本 DeepSeek-V4.1-Flash 通过 CSA2、跨层缓存复用、因果编码器-解码器架构和 FP4 缓存,将全局 KV 缓存降至每 token 890 字节。

这一突破意义重大,因为长上下文模型推理的最大成本之一就是 GPU 显存中保存缓存的开销。由于先进 GPU 获取受限,中国实验室被迫将性能优化作为首要目标,成果显著。

西方 AI 公司因此获得了极高的推理利润率。Anthropic 和 OpenAI 都发布了采用这些优化的顶级模型:Claude Opus 5.5 和 GPT-6.1 Sol,但都选择低调发布,似乎对"借鉴"感到尴尬。缓存读取价格大幅下降——Opus 5.5 比 Opus 5 降低 60%,GPT-6.1 Sol 比 GPT-5.6 Sol 降低 80%。

作者感叹中国实验室免费分享这些突破,为西方亏损的实验室提供了救命稻草,却不解其动机。


HN 热度 373 points | 评论 405 comments | 作者:allisdust | 9 hours ago #

https://news.ycombinator.com/item?id=49910553

  • 许多人批评 Anthropic 虚伪:自己靠大规模抓取人类作品训练模型,却抱怨他人蒸馏自己的模型。
  • 有人认为蒸馏只是“最后 5% 的工作”,真正大量资源投入在预训练,但反对者指出原始内容创作才是真正的重活。
  • 中国开放权重模型被赞扬免费惠及全球,而西方闭源模型却试图建立护城河,形成对比。
  • 蒸馏被看作对资本主义“围墙花园”的打击,模型价值难以被永久锁定。
  • 讨论延伸到知识本身是人类共同成果,任何公司都无权独占或抱怨被“抄袭”。
  • 有人指出西方实验室(如 DeepMind、xAI)也互相蒸馏。
  • 整体情绪偏向嘲讽 Anthropic 的双标,支持开放模型加速进步,并质疑闭源商业模式的可持续性。

9. Tcl/Tk 9.1 发布公告 (Tcl/Tk 9.1) #

https://www.tcl-lang.org/software/tcltk/9.1.html

这个网页是 Tcl/Tk 9.1 版本的官方发布说明页面。Tcl/Tk 9.1.0 是当前开发版本,计划于 2026 年 9 月发布稳定版,页面提供了源代码下载链接,并重点介绍了 Tcl 9.1 和 Tk 9.1 的新增功能。

Tcl 9.1 的主要新特性包括:新增 unicode 命令支持 Unicode 规范化;新增 C 例程 Tcl_UtfToNormalized*;新增 timer 命令提供单调时钟和微秒级分辨率;新增 lfilter 命令用于列表筛选;新增 interp set 命令访问子解释器变量;subst 命令新增-backslashes、-commands、-variables 选项;switch 命令新增-integer 选项;大量 C99 数学函数可作为 expr 函数使用;应用程序需调用初始化例程;新增多个 C 例程如 Tcl_IsEmpty、Tcl_GetEncodingNameForUser 等;改进列表内部机制以提升大列表内存效率;扩展 64 位大小支持;macOS 上支持不区分大小写的文件系统路径;Windows 上改进了 auto_execok 和 exec 搜索;改进了脚本库和编码的搜索方式。

Tk 9.1 的主要新特性包括:无障碍屏幕阅读器支持;初步支持双向文本/RTL 语言;新增 ttk::toggleswitch 小部件;新增 tk attribtable 命令;改进了 Aqua 上的 send 命令;处理负屏幕距离;扩展 ttk::treeview 和 ttk::notebook 的状态;改进 Tk_CanvasTextInfo;支持标签旋转文本;将消息框和对话框限制在物理屏幕宽度内;改进列表框选择颜色;移除了对 Windows XP 外观的过时支持。


HN 热度 296 points | 评论 141 comments | 作者:dmux | 1 day ago #

https://news.ycombinator.com/item?id=49896712

  • 对 Tcl 有特殊喜爱,因其古怪和动态字符串特性,适合玩耍但职业使用需谨慎。
  • Tcl/Tk 开创了脚本语言作为库的先河,线程处理正确,支持多个独立解释器,无 GIL,无需序列化。
  • 硅谷 CAD 自动化大量使用 Tcl,Tcl 是原始扩展语言,在电子 CAD 领域有很长的尾巴。
  • 存在另一个时间线,Ousterhout 的梦想实现,Tcl 填补了 JavaScript 的角色,从技术角度看更好。
  • COBOL 已有 ISO 2023,有 OOP 特性,可做微服务,有现代 IDE,不应抱怨其冗长。
  • 不敢想象 LLM 生成 COBOL 会输出什么。
  • 很多 HN 用户在硅谷 CAD 中遇到 Tcl,留下糟糕体验。
  • Tcl 子解释器最初是作为可控沙箱运行不可信代码,而 JS 却允许不可信代码访问 USB 设备;Python 子解释器与 Tcl 相比是笑话。
  • Tcl 比 JavaScript 早近十年,即使没有子解释器也可以创建多个解释器实例。
  • 安全解释器设计于 1993 年,用于安全运行邮件接收的代码。
  • ActiveX 时代,ActiveState 为 IE 提供了 Tcl、Perl 和 Python 的脚本引擎。
  • Tcl 中少数真正全局实体是当前工作目录和环境变量,因为底层概念泄漏到 C 代码和子进程。
  • Tcl 在跨平台异步 I/O 方面非常容易,在 Windows 上尤其重要。
  • “soft corner” 是印度英语,相当于 “soft spot”。
  • 作者不知道 “soft corner” 是印度用法,还喜欢 “prepone” 这个词。
  • 有人的叔叔认为印度人比英国人更好地使用英语,“prepone” 是例子,印度英语语速快,信息密度高,但需要双方都懂印度英语。
  • 有人用 Tcl/Tk 写了内部工具 UI,日志控件比 C# forms 好,不会 CPU 100% 和 OOM,但代码现在像玛雅象形文字。
  • Python 已移除 GIL,但序列化数据安全仍然相关,不确定是否该用 pickle。
  • Pickle 在创建数据时可能仍然方便,但不要用于用户提供的文件。
  • 有人记得 Zope,认为它做了所有错误选择,静默消亡。
  • Zope 可能仍然存在,但很久没用。
  • 有人永远不会从调试 ZODB(Oracle 备份)中恢复,认为 pickle-based、内存、单进程、几乎事务的数据库很疯狂。
  • 有人用过 Plone CMS,发现它慢且资源密集,但仍在发布;还提到 Open Market 的 Java 产品,XML 模板语言,渲染错误页面。

10. 美国邮政检查员关闭销售假邮资标签的网站 (U.S. postal inspectors shut down website selling counterfeit postage labels) #

https://postalemployeenetwork.com/news/2026/09/26/u-s-postal-inspectors-shut-down-website-selling-millions-of-counterfeit-postage-labels/

美国邮政检查局联合联邦机构关闭了销售假邮资标签的网站 LabelsBank.com,并起诉其运营者、33 岁的巴基斯坦籍男子 Faheem Akram。该网站以每张 2 美元的固定价格出售超过 510 万张伪造的 USPS 邮资标签,造成超过 1.26 亿美元损失。嫌疑人被控一项共谋欺诈美国罪、五项伪造邮票标签罪和四项电信欺诈罪。邮政检查局表示,无论嫌疑人身在何处,都将追查并绳之以法。目前网站域名已被查封,案件正在审理中。


HN 热度 276 points | 评论 166 comments | 作者:ilamont | 1 day ago #

https://news.ycombinator.com/item?id=49899090

  • 有买家怀疑 eBay 卖家使用伪造 USPS 邮资发货以增加利润,被查获后才重新发货,好评率高但存在慢邮、丢失等模式。
  • 有用户收到随商品附赠的可疑 USPS 邮票,卖家以好评换取更多邮票,认为这是伪造行为。
  • 邮票价格暴涨使伪造邮票利润丰厚,且防伪措施不足,Forever 邮票无法更新,执法不力,形成完美风暴。
  • 英国已采用二维码邮票,旧非二维码邮票可免费更换,重复使用会被要求支付罚款;日常邮票有二维码,纪念邮票没有。
  • 有人建议美国可仿效英国用 ID 交换邮票,但二维码方案更公平;也有讨论指出要求 ID 可能影响无 ID 人群,并引发与选举安全要求的类比。
  • 有提到旧式固定面值邮票在邮资上涨时需要补贴,有时会收到硬币。
  • 有提到美国信件超重价格复杂,最大重量信件需两张邮票加 5 美分,也可购买额外盎司邮票。

Hacker News 精彩评论及翻译 #

Livenerf: Has Opus 5.5 been nerfed yet? #

https://news.ycombinator.com/item?id=49902317

We also have Nerf Bench:

https://www.bridgebench.ai/nerf-bench

They test it on launch day, then benchmark it against that. A deviation of above 10% is considered a change. They’re currently tracking Opus 5.5 and GPT-6 Astra.

This bench famously detected a degradation of Opus 4.6 which Anthropic later blogged about. I personally think people sense nerfs more often than they happen and that it’s often about honeymoon effects.

jug

我们也有Nerf Bench:

https://www.bridgebench.ai/nerf-bench

他们在发布当天进行测试,然后以此为基准进行对比。偏差超过10%即视为变化。目前他们正在追踪Opus 5.5和GPT-6 Astra。

这个基准测试曾因检测出Opus 4.6的性能下降而闻名,Anthropic后来在博客中提到了这一点。我个人认为,人们感知到的“削弱”往往比实际发生的更多,而且这通常与蜜月效应有关。


Gemini 4 Argon #

https://news.ycombinator.com/item?id=49913755

Ten days ago I had an experience with Gemini 3.8 flash that made me wonder if I was being routed to a different model under test. I was trying to use rocm with llama.cpp on my 128gb Strix Halo but could only get it to run Vulkan. I pasted the error message into agy and it proceeded to attach GDB to my GPU driver, reverse-engineer the kernel queue ioctl interface, and author an LD_PRELOAD C shim to get ROCm llama.cpp working on my Strix Halo. My jaw was hanging open the whole time.

Edit to add the fix: https://gist.github.com/birep/6f2c8d490c7a29820997d57bd654c351

taylorfinley

十天前,我在使用Gemini 3.8 flash时遇到了一次经历,让我怀疑自己是不是被路由到了某个正在测试的不同模型。我当时试图在128GB的Strix Halo上配合llama.cpp使用ROCm,但只能让它跑Vulkan。我把错误信息粘贴到agy里,结果它居然对我的GPU驱动附加了GDB,逆向工程了内核队列的ioctl接口,并编写了一个LD_PRELOAD的C语言垫片,让ROCm版的llama.cpp成功跑在了我的Strix Halo上。整个过程我的下巴一直合不拢。

编辑补充修复方案:https://gist.github.com/birep/6f2c8d490c7a29820997d57bd654c351


The AI Race Just Got Awkward #

https://news.ycombinator.com/item?id=49910947

Why is it a problem that the Chinese labs are just distilling down Anthropic’s models? Aren’t Anthropic’s models not just distilling down other people’s work?

Feels like Anthropic crying do as I say not as I do.

cmiles8

中国实验室只是在蒸馏Anthropic的模型,这有什么问题?难道Anthropic的模型不也是在蒸馏别人的成果吗?

感觉Anthropic就像在喊“照我说的做,别学我做的”。


Gemini 4 Argon #

https://news.ycombinator.com/item?id=49913802

The important take away here: the leapfrogging we’ve seen this year doesn’t seem to be a temporary thing. The famous theory of Dario Amodei was that AI was this winner-takes-all field where the first team to get a head start would never cede ground back. The term he liked to use was, “concentrating”. This is yet another datapoint that he was wrong about that. AI seems more distributed amongst neoclouds and traditional hyperscalers, FAANG and startups, GPUs and ASICs than it did this time a year ago.

Nobody has a moat.

nickysielicki

这里的重要启示是:我们今年看到的跨越式发展似乎不是暂时现象。Dario Amodei的那个著名理论是,AI是一个赢家通吃的领域,率先取得领先的团队永远不会把地盘让回去。他喜欢用的词是“集中化”。而这是又一个证明他错了的数据点。相比一年前,AI似乎更加分散地分布在新型云厂商和传统超大规模云厂商、FAANG和初创公司、GPU和ASIC之间。

没有人拥有护城河。


The AI Race Just Got Awkward #

https://news.ycombinator.com/item?id=49911174

But the analogy still holds.

The original authors of all the text, creators of the media and developers of the software did far more work than Anthropic.

JackFr

但这个类比依然成立。所有文本的原始作者、媒体创作者和软件开发者所做的工作远多于Anthropic。


Burning Man death rates – A short lesson in statis… #

https://news.ycombinator.com/item?id=49912204

Some of this is selection bias, but lots of this is active work by the organizers.

Burning Man has slowly re-created the regulatory state in response to the standard pressures of civilization. To their credit, this has often been in response to near-misses, but sometimes in response to fatalities. It started with sanitation (potties), and banning guns/explosives. You can have 100 people shooting guns at a party in the desert without sanitation and muddle through. At 10k, you are building a cholera-mad-max experiment. A car running over a sleeping person prompted a designated road network. And then they adopted zoning, with hush-ville and the large sound installation ends. All supported by the ranger team preventing injury every day. Civilization is work.

michael1999

这部分有些是选择偏差,但很多是组织者积极作为的结果。

火人节在应对文明的标准压力时,慢慢地重新打造出一套监管体系。值得称赞的是,这往往是针对未遂事故的回应,但有时也是针对死亡事件的回应。它始于卫生设施(移动厕所)和禁止枪支/爆炸物。你可以让100个人在没有卫生设施的沙漠派对上开枪,也能勉强应付过去。但到一万人时,你就是在搞一个霍乱版《疯狂的麦克斯》实验。一辆车碾过熟睡者的事件,催生了指定的道路网络。接着他们采用了分区制,划出了安静区和大型音响设施的边界。所有这一切都有护林员团队的支持,他们每天都在防止伤害发生。文明是需要付出努力的。


Gemini 4 Argon #

https://news.ycombinator.com/item?id=49913640

My girlfriend, you wouldn’t have met her, she lives in Canada, has seen it and she thinks Gemini 4 Argon is amazing.

SwellJoe

我女朋友,你没见过她,她住在加拿大,她见过这玩意儿,她觉得Gemini 4 Argon棒极了。


GPT 6.1 Sol: Near-Astra intelligence for a fifth o… #

https://news.ycombinator.com/item?id=49898356

I am yet to spend $200 on deepseek this year. Not sure what kind of usage can justify $200/month of either openai or anthropic, i’m not even talking about $500. Deepseek is faster, IMO intelligence difference is negligible and it so much cheaper that i no longer care about how much i use it. I never hit any daily/weekly quota or anything like that while working or tinkering. At this point i am OK with being 6 months behind the “frontier”, purely on bang-for-buck basis and who cares which shadowy government gets my data.

proxysna

我今年还没在DeepSeek上花过200美元。不知道什么样的使用量才能证明OpenAI或Anthropic每月200美元的开销是合理的,更不用说500美元了。DeepSeek更快,在我看来智能上的差异可以忽略不计,而且便宜太多了,以至于我根本不在乎用多少。我工作或折腾的时候从来没遇到过任何每日/每周配额限制之类的东西。到目前为止,我完全不介意落后“前沿”6个月,纯粹从性价比来看,而且谁在乎哪个神秘政府拿到我的数据呢。


Everybody’s home. No one’s coming over #

https://news.ycombinator.com/item?id=49892091

As others have mentioned, the decline started long before social media and the Internet. When I was a child, in the 70s, my parents often had other families and couples over for dinner, and we often attended small dinner parties, too.

As an introvert, I absolutely loathed these gatherings and was frustrated by how powerless I was in avoiding them.

Recently, I have been reading over my mother’s old letters she wrote to her parents at that time, in which she described the effort and social anxiety that went with this tradition. It was not something my parents enjoyed, but rather an obligation they felt they had to uphold. Someone invites you over, then that goes into an unspoken balance sheet, and you are required to reciprocate. She often spoke of “owing” dinner to people. I don’t think she enjoyed it at all, though there were a few couples I can remember who were good friends of theirs, and those meetups were always a pleasure to listen in on. The rest were simply a drag.

I should note that their life in the 70s (in a middle-class college town) was not some idyllic paradise without the Internet, either. Everyone was constantly falling ill with colds or flu, and days were spent running dreary errands to shop for boring things that we now can get with a click. The rotary-dial telephone that hung in the kitchen was the heartbeat of the house, since replaced by Facebook and smartphones. My parents were always busy and exhausted.

vertnerd

正如其他人所说,这种衰退早在社交媒体和互联网出现之前就开始了。我小的时候,也就是七十年代,父母经常邀请其他家庭和夫妇来家里吃饭,我们也经常参加小型晚宴。

作为一个内向的人,我非常讨厌这些聚会,也为自己无力逃避它们而感到沮丧。

最近,我一直在翻看母亲当时写给她父母的一些旧信,信中描述了这种传统带来的精力和社交焦虑。这不是我父母享受的事情,而是他们觉得必须履行的义务。有人邀请了你,那就记在了一笔无形的账上,你必须回请。她经常说“欠”别人一顿饭。我觉得她根本不喜欢这样,不过我记得有几对夫妇是他们的好朋友,那些聚会听起来总是令人愉快的。其余的都是纯粹的负担。

我还得说明,他们在七十年代(在一个中产大学城)的生活也不是什么没有互联网的田园牧歌。每个人都经常感冒或得流感,白天则花在无聊的跑腿采购上,买那些现在一键就能搞定的无聊东西。厨房里挂着的旋转拨号电话是房子的心脏,后来被Facebook和智能手机取代了。我父母总是忙忙碌碌、精疲力竭。


How Delhi cut electricity loss from 50 to 5 percen… #

https://news.ycombinator.com/item?id=49892638

I wonder how many HNers recall life in Delhi even 20 years ago? Cutting electricity loss is one thing, but getting rid of “load shedding” (unplanned power cuts) is the really revolutionary part. It was not uncommon for the power to go out several times a day and you had to rush to unplug expensive appliances (TV, laptop), because when the power came back it was often accompanied by a surge. My office was wired with two sets of electrical sockets, one connected to grid mains and the other connected to the UPS (for important equipment only).

motionlessveloc

不知道有多少HN用户还记得甚至20年前德里的生活?减少电力损耗是一回事,但消除“拉闸限电”(计划外停电)才是真正具有革命性的部分。那时一天停电几次并不罕见,你必须赶紧拔掉昂贵电器(电视、笔记本电脑)的插头,因为电力恢复时往往伴随着电压浪涌。我的办公室装了两套电源插座,一套连接电网主电源,另一套连接UPS(仅用于重要设备)。


Gemini 4 Argon #

https://news.ycombinator.com/item?id=49913608

We’ll continue to gather feedback from early testers as we iterate on guardrails before making Argon available to developers, enterprises, and consumers as soon as possible.

Gemini not beating the “can’t release a model” allegations

babelfish

“我们将继续收集早期测试者的反馈,并在尽快向开发者、企业和消费者推出Argon之前,不断迭代护栏。

Gemini并未驳倒‘无法发布模型’的指控。”


GPT 6.1 Sol: Near-Astra intelligence for a fifth o… #

https://news.ycombinator.com/item?id=49896762

Cached input costs just $0.10 per million tokens—95% less than standard input pricing and 50% less than GPT‑6 Sol’s cached input pricing

This is the actual big announcement. 50% cheaper cache than GPT-6 Sol will get you far more mileage on Codex.

minimaxir

缓存输入成本仅为每百万token 0.10美元——比标准输入定价低95%,比GPT-6 Sol的缓存输入定价低50%。

这才是真正的大消息。缓存比GPT-6 Sol便宜50%,会让Codex的可用性大幅提升。


Dots: Always-on agents #

https://news.ycombinator.com/item?id=49898996

im crying and throwing up everywhere. everything i use must be brutalist.

even seeing the linux penguin makes me want to punch my monitor and commit sudoku

john_strinlai

我在哭泣,到处呕吐。我用的每样东西都必须是粗野主义风格的。

就连看到Linux的企鹅都让我想猛击显示器,然后玩个数独。


A Staff Engineer’s Guide to Inventing Work #

https://news.ycombinator.com/item?id=49898093

Platform teams are engineering-led rather than product-led. There is almost never a product manager handing you a roadmap, no revenue line to follow, and no market to lose.

It’s precisely because of this framing and mentality that platform teams don’t actually serve people well and are usually highly dysfunctional towers of people inventing work.

The fix for having no market is to act like the teams you serve could leave. This whole article lists signals, and none of them is that. Being captive does not mean the users or internal teams don’t have other options and don’t notice. Being product-led means caring about your users. A platform teams should be product-led, not engineering-led in that very narrow meaning. Otherwise you invent work as this article so wonderfully exposes.

dabedee

平台团队是工程主导,而非产品主导。几乎从来没有产品经理给你一份路线图,没有收入指标可循,也没有市场可失去。

正是由于这种框架和心态,平台团队实际上并不能很好地服务他人,而且通常是高度 dysfunctional 的一群人在自造工作。

解决没有市场这一问题的办法,是把你所服务的团队当作随时可能离开的客户。这篇文章列了一堆信号,但没有一条是这一点。被绑定(captive)并不意味着用户或内部团队没有其他选择,也不意味着他们察觉不到。产品主导意味着关心你的用户。平台团队应该以产品为主导,而不是那种狭隘意义上的工程主导。否则,你就会像这篇文章精彩揭露的那样,自造工作。


September 2026: The world today, as seen by one Po… #

https://news.ycombinator.com/item?id=49906503

I’m Polish, but this is such a pessimistic, overdramatic take. The visualisations are impressive, but you’re living in Poland’s golden age. See this Hacker News story with 1,000+ upvotes: https://news.ycombinator.com/item?id=48062117

The war in Ukraine is a tragedy, but it has proved that Russia is weak. The price shock will speed up the transition to renewables, and Iran is losing its grip on Hormuz. So many of the other issues are solvable.

It’s easy to be a pessimist, but there’s a bright future ahead of us.

jakozaur

我是波兰人,但这是一个如此悲观、过度戏剧化的观点。可视化做得令人印象深刻,但你正生活在波兰的黄金时代。看看这个有1000多个赞的Hacker News帖子:https://news.ycombinator.com/item?id=48062117

乌克兰战争是一场悲剧,但它证明了俄罗斯很虚弱。价格冲击将加速向可再生能源的转型,而伊朗正在失去对霍尔木兹海峡的控制。其他许多问题都是可以解决的。

做悲观主义者很容易,但我们的前方是光明的未来。


GPT 6.1 Sol: Near-Astra intelligence for a fifth o… #

https://news.ycombinator.com/item?id=49897983

There was a model called Astra-Minor, found in the files a few days ago. I assume Sol 6.1 is this, as a last minute panic rename due to Sol 6 being underwhelming while Opus 5.5 turned out really strong. I can’t really explain releasing Sol 6 in any other way, especially mere days ago. revolvingthrow

几天前在文件里发现了一个叫 Astra-Minor 的模型。我猜 Sol 6.1 就是它,因为 Sol 6 表现平平,而 Opus 5.5 却非常强,所以临时慌忙改了个名。否则我实在无法解释为什么会在仅仅几天前发布 Sol 6。


Backblaze drive stats for Q2 2026 #

https://news.ycombinator.com/item?id=49904089

In 2013 Backblaze saw ~14% avg failure rate at 3 years 3 months. Drive useful life: 4 years, roughly.

In 2021, Backblaze saw ~14% failure rate at 7 years 9 months. Drive useful life: about 6 years.

That gave us what was a stable-seeming, old “replace drives at 5 years, or you’re getting risky” rule of thumb (unless you prefer to replace on failure, of course).

In 2025, Backblaze saw ~5% failure rate at 10 years 3 months. Drive useful life: ~10 years, roughly!

Thanks for all the HDD improvements, industry!

realityfactchex

2013年,Backblaze观察到硬盘在3年3个月时的平均故障率约为14%。硬盘有效寿命约为4年。

2021年,Backblaze观察到硬盘在7年9个月时的故障率约为14%。硬盘有效寿命约为6年。

这给了我们一条看似稳定的旧经验法则:“硬盘用满5年就该更换,否则风险会上升”(当然,除非你更倾向于坏了再换)。

2025年,Backblaze观察到硬盘在10年3个月时的故障率约为5%。硬盘有效寿命大约为10年!

感谢整个行业在硬盘技术上取得的所有进步!


Nicholas Polson has authored 258 academic papers i… #

https://news.ycombinator.com/item?id=49899294

“An Interdisciplinary Synthesis Across Economics, Psychology, Biology, Philosophy, Game Theory, and Spiritual Tradition.”

If one were inclined, they could shorten the title to “AI Synthesis Across Economics, Psychology, Biology, Philosophy, Game Theory, and Spiritual Tradition.” Maybe that’s an Easter egg.

AI submissions, soon AI reviewers, and shortly after only AI readers.

The guy’s name is “nosloP” spelled backwards. Maybe spelled normally it’s supposed to signify the opposite.

buran77

“跨越经济学、心理学、生物学、哲学、博弈论与精神传统的跨学科综合。”

如果愿意的话,可以把标题缩短为“跨越经济学、心理学、生物学、哲学、博弈论与精神传统的AI综合”。也许那是个彩蛋。

很快是AI投稿,接着是AI审稿,再不久就只剩下AI读者了。

那家伙的名字倒着拼是“nosloP”。也许正着拼写本该表示相反的意思。


The AI Race Just Got Awkward #

https://news.ycombinator.com/item?id=49910863

I’m also grateful to the Chinese labs for providing workarounds for the walled gardens that the US based AI companies are attempting to create.

Does anyone know if there are any distillation datasets available? I’d love to see these distributed on BitTorrent. I think it’s critical that AI be democratized and not isolated in the hands of a few private companies.

slowin

我也很感激中国的实验室为美国AI公司试图建立的围墙花园提供了变通方法。有没有人知道是否有可用的蒸馏数据集?我很乐意看到这些通过BitTorrent分发。我认为AI的民主化至关重要,而不是被少数私营公司垄断。