2026 09 30 HackerNews

2026-09-30 Hacker News Top Stories #

  1. Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本降低 30%,代理编码评测得分 70.6%,还能仅凭截图通关宝可梦红版。
  2. 美国家庭待客文化急剧衰落,每月在家招待朋友的比例从 1975 年的 42% 降至 2026 年的 12%。
  3. Cal Newport 批评 OpenAI 和 Anthropic 营造"超级智能不可避免"的氛围,呼吁国会调查 AI 实验室的安全流程与意识形态。
  4. 开源项目 Jeff 通过单次前向传播返回校准概率,2B 版本准确率达 82%,接近 Jev 的 83%,且完全在本地训练。
  5. 恶搞网页 Windows 11½ 精准还原并调侃了现代软件的订阅、广告和 AI 功能泛滥现象。
  6. EFF 揭露 DraftKings 用 AI 识别"问题赌徒"并推送定向广告,呼吁全面禁止在线行为广告。
  7. 英国警方在伦敦火车站扫描 50 万张人脸,花费逾 32 万英镑,最终零逮捕、仅一次误报。
  8. 作者发现 macOS Golden Gate 存在大量 Bug,包括界面错乱、应用崩溃,甚至吸管工具会导致系统死机。
  9. 德里通过系统性改造,将电力损耗从 50% 以上降至 5% 至 6%,电网可靠性达 99.9% 以上。
  10. 论文分析九款对话式 AI 服务,发现用户提示词和对话标题被泄露给广告生态,动摇了"私密交流"的认知。

1. Claude Sonnet 5.5 (Sonnet 5.5) #

https://www.anthropic.com/claude-sonnet-5-5

Claude Sonnet 5.5 是 Anthropic 发布的 Claude 5.5 系列第二个模型,相比 Sonnet 5 运行速度快 30% 以上,大多数任务成本降低最多 30%。它是 Opus 5.5 的补充,擅长日常任务、修复 bug、制作文档和表格,并具备出色的设计眼光。Haiku 5.5 将在未来几周加入该系列。

性能方面,Sonnet 5.5 在 Terminal-Bench 4.0 代理编码评测中得分 70.6%,远超 Sonnet 5 的 10.3%;在 GDPval-AA 测试中仅比 Opus 5.5 低 2 分。它还是首个仅凭截图就能通关宝可梦红版的 Sonnet 模型。在编码、知识工作、多学科推理、计算机使用和图表识别等多个基准测试中均有显著提升。

定价与 Sonnet 5 相同(输入每百万 tokens 2 美元,输出 10 美元,缓存读取 0.2 美元),但完成相同任务所需 tokens 更少,每任务成本最高降低 30%。在协作能力、写作质量和对齐安全性上也有改进,并首次为 Sonnet 系列配备了网络防护措施。

在编码方面,Sonnet 5.5 在 FrontierCode 高努力模式下比 Sonnet 5 同设置高 10 分,成本仅约十五分之一;在 CursorBench 上得分接近 Opus 5.5。早期测试者称赞其快速理解代码库、高效批处理工具调用,Epic Games、Every、CodeRabbit 等公司均给出积极评价。


HN 热度 867 points | 评论 601 comments | 作者:D2OQZG8l5BI1S06 | 1 day ago #

https://news.ycombinator.com/item?id=49881850

  • Opus 5.5 效率太高,5x 计划的额度已经足够日常使用,Sonnet 5.5 反而显得没有用武之地;token 需求可能短期见顶,供应可能超过需求,形成经济低谷。
  • 不懂编程的“vibe coders”反而消耗更多 token,因为他们用 token 换时间,且项目常处于混乱状态,模型需要处理大量技术债。
  • 程序员仍固守 LLM 前的架构、设计和代码质量观念,这些观念依然重要但可能被高估,限制了 token 的消耗。
  • LLM 不擅长数据结构设计,倾向于选择表面合理但考虑不周的方案,然后烧 token 处理实现细节,而不是直接修正根本问题。
  • LLM 对数据结构问题接受指导,所以明确要求时它们能做好;但默认会避免改变已有结构,像初级开发者一样谨慎,倾向写更多代码。
  • 抱怨 LLM 产出“slop”部分是因为没要求它们重构,编码 agent 不会主动做用户没要求的重大改变。
  • 让 LLM 自然学会更好的数据结构选择需要强化学习管道,不会自动发生;但依赖 RL 补漏有点像机械土耳其,真正 AGI 应能从现有数据中自行推导。
  • 是否真 AGI 不重要,有用性、危险性和影响才重要。
  • 能做出真正周全数据结构选择的模型将超越普通 LLM,成为更通用的智能体;但由 Claude Code 等工具驱动时,LLM 已经能在大型代码库中持续做出优秀的数据结构和架构选择,甚至感觉像 AGI。
  • 非程序员缺乏相关上下文,不知道如何引导模型优化数据结构选择。
  • 如果开发者不清楚自己在做什么,开发最终会停滞;即使模型单步效率 99%,错误也会积累,复杂系统会在不确定性下崩溃,token 再多也没用。
  • 当前很多任务已接近 99% 准确率,再提升一两个九就能极大延长可自主处理的任务长度,配合好的任务切片和分发技巧,仍有革命性空间。
  • LLM 仍在持续改进,也许一年后就能自己修复代码问题。

2. 人人都在家,却没人来做客。 (Everybody’s home. No one’s coming over) #

https://www.derekthompson.org/p/the-death-of-the-american-host

这是一篇来自《大西洋月刊》作者 Derek Thompson 的文章,探讨了美国家庭待客文化在过去半个世纪中的惊人衰落。

文章的核心发现是:根据调查数据,1975 年有 42% 的美国人表示每月至少在家招待一次朋友或家人,而到 2026 年这一比例骤降至 12%,跌幅高达 70%。文章引用了 Robert Putnam 在 2000 年《Bowling Alone》(独自打保龄)中的预言——如果这一趋势持续,朋友互访的传统将在不到一代人的时间内从美国生活中完全消失。如今看来,这一预言正在成为现实。

文章驳斥了两种常见的乐观解释:一是认为人们只是把社交场所从家中转移到了餐厅和酒吧,但数据显示面对面社交整体在下降,且独自用餐的人数在激增;二是认为人们用其他健康活动替代了晚宴,但研究表明运动热潮大多是独自进行的,且自 2010 年代以来人们在家时间不降反升。

作者提出了几个核心解释:第一,双职工家庭让时间变得稀缺,人们更倾向于用碎片化、半生产性的方式度过休闲时间(如边看剧边回邮件),而筹备晚宴需要大量协调成本;第二,女性在 1970 年代大量进入职场,但男性并未接替她们作为"家庭社交日历管理者"的角色,导致家庭社交网络逐渐瓦解;第三,密集型育儿文化的兴起——父母(尤其是母亲)与孩子相处的时间大幅增加,进一步挤压了成人社交空间。

文章标题"你不再被邀请共进晚餐"正是对这一社会变迁的精准概括:美国人并没有找到新的社交方式来替代家庭聚会,而是正在经历一场"大取消邀请"(great disinvitation)。


HN 热度 697 points | 评论 641 comments | 作者:barry-cotter | 12 hours ago #

https://news.ycombinator.com/item?id=49891295

  • 社交活动的衰落早在互联网和社交媒体之前就已开始,70 年代的聚会常是义务而非享受,父母们疲惫不堪,生活也并非理想。
  • 并非所有有益的事都令人愉快,逃避麻烦会导致孤独、被动和抑郁;现代对减少“摩擦”的追求可能不明智。
  • 过度追求舒适和便利会缩小舒适区,产生不满意结果,如《魔兽世界》因便利化而失去重要东西。
  • 我们过着过于脆弱、珍贵的生活,容易导致抑郁和不良行为,类似“老鼠乌托邦”实验的预测。
  • 便利和舒适并非关键,真正重要的是责任和自我实现;人们需要压力和挑战来获得成长。

3. 是时候调查 AI 实验室了 (It’s Time to Investigate the AI Labs) #

https://calnewport.com/its-time-to-investigate-the-ai-labs/

这篇文章是 Cal Newport 发布于其博客的一篇评论文章,题为《是时候调查 AI 实验室了》。文章批评了 OpenAI 和 Anthropic 等前沿 AI 实验室近期的行为,认为它们通过精心策划的公告和公开辩论,试图营造一种“超级智能不可避免”的宿命论氛围,从而让公众接受其技术路线。

作者指出,Anthropic CEO Dario Amodei 发表公开信,不仅罗列自家研究可能造成的危害,反而呼吁政府放慢对竞争对手的限制、由实验室主导技术发展,OpenAI CEO Sam Altman 随即表示支持。作者认为这种“弥赛亚式”思维让实验室自视为人类救世主,行为日益鲁莽。

为此,作者在《纽约时报》发表专栏,呼吁国会展开公开调查,重点考察三个方向:一、区分具体有问题的 AI 系统类型,而非笼统谈论“AI”;二、审查实验室内部安全流程,例如 OpenAI 自主代理多次发起未授权黑客攻击却未被叫停;三、调查末世论意识形态如何影响实验室的研究决策和速度。作者最后强调,不应让少数私营公司以越来越古怪的方式左右公众对 AI 的认知,国会应代表公众介入调查真相。

文末附有多条读者评论,讨论实验室要求政府监管实为设置竞争壁垒、推卸安全责任等观点。


HN 热度 593 points | 评论 261 comments | 作者:ibobev | 1 day ago #

https://news.ycombinator.com/item?id=49883471

  • AI 只是矩阵数学,关键在于连接什么,应更多讨论愿意将 AI 连接到哪些领域,而非模型本身有多可怕或多有能力。
  • 监管 AI 本身无意义,应监管具体应用,如自动驾驶撞人无论是否用 AI 都应禁止,多数 AI 应用已有现成法规覆盖。
  • 用枪支管制类比:既然杀人已违法,为何还要管制枪支?说明仅靠结果追责不够,需对技术本身设限。
  • 美国确实因类似逻辑而几乎不管制枪支,但仍有例外,如重罪犯禁枪、特定场所禁携枪。
  • 枪支管制正是对应用的监管:枪是技术,用枪做什么是应用,不同主体、场景应有不同权限。
  • 管制和禁止不同,无法完全禁止枪支或 AI,但可以分级监管,如饮酒与驾驶分层次立法。
  • 不应追求“禁止坏”,而应通过监管最小化损害,禁止往往效果不佳。
  • 军事、警察等有正当需求可持枪,普通公民或疯子不应随意持有,类似地,自主杀人机器也应受限。
  • 枪支是燃烧等通用技术的应用,AI 同理,应针对具体应用(如 AI 诊断黑色素瘤 vs 自主作战)划界。
  • 自动驾驶不一定要用 AI,传统自动化(如火车、飞机自动驾驶)早已存在,AI 定义本身模糊且不断漂移。

4. Jeff – 兼容 Jev 的 0.8B 决策模型,在家训练,约 30 毫秒 (Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms) #

https://github.com/firelex/jeff

这是一个名为 Jeff 的开源项目,由 GitHub 用户 firelex 开发,用于构建零样本分类的小型快速决策模型。其核心功能是:你描述一个情境并列出选项,Jeff 通过单次前向传播返回每个选项的校准概率,无需生成文本或解析,速度极快(RTX PRO 6000 上约 22 毫秒/次,Apple M4 Max 上约 28 毫秒)。

主要特点:

  • 零样本能力:选项可以是任意内容(支持工单、用户意图、审核标签、语音命令、游戏走法等),无需在训练数据中出现
  • 三种问题类型:choice(最多 254 个选项)、noul(是/否概率)、score(评分),多个独立问题可在一个请求中同时回答
  • 模型版本:基于 Qwen3.5 和 Gemma 4 微调,提供 0.8B、2B 和 Gemma4 E2B 等版本,以及国际象棋微调模型

性能表现: 在 5 个公开基准测试(4,599 个问题)中,Jeff-Qwen3.5-2B 达到 82.0% 的总体准确率,接近 Jev 的 83.0%;0.8B 版本从 45.3% 提升至 79.1%。v1.1 版本支持最多 254 个选项(v1.0 为 26 个),长列表测试中 0.8B 模型从 40% 提升至 95%。

训练方式:完全在本地硬件上完成(单张 RTX PRO 6000,0.8B 约 2 小时,2B 约 3.5 小时),使用开源模型生成合成训练数据,无云 GPU 依赖。项目独立于 Jev,但使用相同的请求格式,并基于开源的 AutoJev 配方。


HN 热度 564 points | 评论 218 comments | 作者:firelex | 1 day ago #

https://news.ycombinator.com/item?id=49883844

  • 有更 impressive 的 Doom 演示,能主动追击怪物、权衡健康、改变目标并完成关卡,不只是对着静态怪物射击。
  • 原 demo 也能通过改变变量来改变目标,但并未实际展示,因此他人的演示更令人印象深刻。
  • 将“有潜力”与“实际做到”混为一谈是不对的,演示比潜力更令人印象深刻。
  • Laya 接收的是语义快照而非帧缓冲,需要为每个应用编写适配代码将游戏状态转换为结构化数据。
  • Laya 基础模型世界知识不足,零样本能力弱,接近随机,因此是死胡同。
  • Laya 设计用于微调,微调后准确率显著提升,校准误差大幅下降,不应直接与 Jev 比较基础模型。
  • 如果价值在于通用性,Laya 确实不行;但如果针对特定任务微调,它是有用的。
  • 有人猜测评论被标记是因为听起来像 LLM。
  • 可以用嵌入模型加简单分类器(如 MLP、SVM)解决分类问题,无需额外 LLM。
  • 对于简单问题,传统分类器足够;但 LLM 能处理更难的问题,Jev 提供快速廉价的通用分类。
  • 商业 LLM 使用中大部分是编码,分类通常用轻量模型而非前沿模型。
  • 如果商业 AI 支出发现不需要完整 LLM,美国股市可能损失 20% 价值。

5. Windows 11½ - 绝对不是 Windows (Windows 11½) #

https://definitelynotwindows.com/

这是一个模仿 Windows 11 操作界面的恶搞网页,名为“Windows 11½”,副标题是“Definitely Not Windows”(绝对不是 Windows)。页面明确声明这是一个非官方的讽刺项目,与微软公司无关,目的是调侃现代软件订阅、广告、AI 功能、系统更新和存储空间提醒等常见现象。

页面模拟了完整的桌面环境,包括任务栏、开始菜单、系统托盘(显示 2026 年 9 月 30 日的时间),以及多个模拟应用窗口:

  • Edge 浏览器:讽刺用户下载 Chrome 时的劝阻界面,声称 Edge“更难卸载”。
  • Word 文档:显示“编辑已禁用”,要求用户反复验证 Microsoft 365 订阅。
  • Excel 表格:列出各种订阅费用(如 Microsoft 365、OneDrive、Copilot Pro 等),总计显示“#SUBSCRIPTION!”错误。
  • Outlook 邮箱:提示邮箱 99.97% 已满,收件箱塞满了订阅推广、广告和系统通知。
  • Teams 会议:模拟会议加入界面。
  • Copilot 助手:讽刺 AI 功能“深度集成到原本正常的功能中”。

页面还包含一个“关于”窗口,详细解释了这是一个虚构的恶搞项目,不会真正请求任何微软凭据,访客计数器仅使用随机 ID 记录访问次数。整体风格幽默,精准还原了 Windows 11 的视觉设计,同时通过夸张的弹窗和提示(如“您的存储已满”“检测到 Chrome 下载已阻止”)制造讽刺效果。


HN 热度 518 points | 评论 172 comments | 作者:jjbinx007 | 1 day ago #

https://news.ycombinator.com/item?id=49881747

  • 讽刺 Windows UI 缓慢:资源管理器上下文菜单和开始菜单打开慢,音量滑块有延迟,微软应该学习。
  • 该网站是恶搞,但做得很好,UI 响应快,web 应用比原生应用更快更流畅。
  • 也有人表示尽管开始菜单混乱,但并未觉得 Windows 慢。
  • Windows 桌面总是有各种弹窗和提示不断争夺注意力,即使配置了也难以避免。
  • Edge 主页满是点击诱饵和分心内容,让人无法集中精力,应该把浏览器做好而不是靠诱饵。
  • 对 Copilot 被限制感到可笑,担心搜索在线内容会泄露数据是误解。
  • 讽刺 Defender 扫描多次却什么都没找到。
  • 切换到 Fedora 后没有怀念 Windows,Windows 只会越来越糟。
  • 在 Mac M1 虚拟机中尝试 Linux 性能很差,游戏无法玩,Linux 仍然难以尝试。
  • 虚拟机性能差更多是 VMware 或虚拟机配置的问题,不是 Linux 的问题,应该用 Parallels 或 Asahi,或使用合适的硬件。
  • Linux 生态碎片化让新手难以接近,发行版网站应设定

6. DraftKings 正在利用 AI 对长期赌徒进行行为定向 (DraftKings is using AI to behaviorally target chronic gamblers) #

https://www.eff.org/deeplinks/2026/09/draftkings-using-ai-supercharge-harms-online-behavioral-advertising

该网页是电子前沿基金会(EFF)发布的一篇深度分析文章,聚焦在线体育博彩公司 DraftKings 利用人工智能(AI)强化行为广告危害的问题。

文章指出,DraftKings 通过分析客户的投注记录训练机器学习模型,专门识别那些最可能持续输钱并回应赌博促销的“问题赌徒”,然后向他们推送定向广告,诱使其继续下注。由于这些用户正是为公司创造利润的群体,DraftKings 实际上是在利用他们的脆弱性获利,而非帮助他们规避风险。

文章强调,虽然这种掠夺性行为广告并非新鲜事,但 AI 的介入显著放大了其危害:AI 需要收集更多数据来训练模型,处理数据的速度更快,且其“黑箱”特性使人类难以预测哪些数据点会被使用,从而形成数据收集的恶性循环。此外,行为广告所积累的数据还被出售给保险公司、银行以及 CBP、ICE 等政府执法机构,用于监控和调查目的。

值得注意的是,DraftKings 仅使用“第一方数据”(即直接从用户处收集的数据),这表明仅限制第三方数据共享的政策远远不够。EFF 因此呼吁全面禁止在线行为广告,并建议用户通过其“Surveillance Self Defense”等资源保护个人隐私。


HN 热度 515 points | 评论 361 comments | 作者:paimapi | 6 hours ago #

https://news.ycombinator.com/item?id=49896050

  • DraftKings 利用 AI 针对慢性赌徒进行行为定向,毫无商业道德可言
  • 职业体育联盟与 DraftKings 这类公司深度绑定,迟早会爆发类似 Pete Rose 的丑闻,甚至更糟
  • 这类公司本质上是社会负外部性,其存在本身就意味着不道德
  • 广告技术构建了虚拟用户画像,可被反复试探和研究,用户隐私面临严重威胁
  • 亚马逊“关于你”页面展示的画像过于肤浅,且其“导入 AI 助手信息”功能存在隐私泄露风险,设计草率且不透明
  • 亚马逊的广告定向并不精准,会推送无关语言或内容的广告,说明其数据模型并非无所不知
  • 亚马逊“关于你”功能可能刻意隐藏敏感购买记录(如性玩具、恋物服饰),只展示无害信息
  • 删除“关于你”数据后推荐并无变化,怀疑删除操作只是界面隐藏,并未真正清除后台数据
  • 亚马逊“关于你”功能可能被用户恶意或意外污染,产生荒谬的“记忆”条目
  • 美国政商勾结,消费者成为企业数据挖掘和心理实验的“小白鼠”,经济以开采用户数据为资源
  • 选民对这类问题的漠视与纵容,与企业的主动作恶同样负有责任,但两者责任程度不可等同

7. 英国车站 50 万次面部扫描未致任何逮捕,仅 1 次误报 (500k facial scans at UK stations yield no arrests, 1 false positive) #

https://www.theguardian.com/technology/2026/sep/29/trial-live-facial-recognition-cameras-london-stations-false-positive

英国交通警察在伦敦多个繁忙火车站进行了为期六个月的实时面部识别技术试验,扫描超过 50 万张人脸,花费逾 32 万英镑,耗费近 100 小时警力,最终仅产生一次错误匹配,且无人被捕。该试验旨在识别嫌疑人及违反法院命令者,但效果不佳。尽管结果如此,警方仍将试验延长四个月,并扩展至地铁站。伦敦交通局称该技术将针对警方观察名单上的人员,以应对针对女性与女孩的暴力。有批评者指出,警方需证明使用该技术的必要性和相称性,并呼吁在完善法律框架前暂停推广。警方回应称,试验期间还通过其他方式进行了相关逮捕,并强调观察名单的构建是谨慎且受控的。


HN 热度 461 points | 评论 279 comments | 作者:ilamont | 11 hours ago #

https://news.ycombinator.com/item?id=49891480

  • 扫描 500k 张脸只抓不到人,可能是因为部署时间极短,实际覆盖率很低
  • 500k 是扫描次数而非人数,大量是同一批通勤者重复出现,且很多画面质量不足以识别
  • 警方声称未触发警报的图像和生物数据会立即删除,但可能只删了图像,仍保留了位置、时间等元数据
  • 即使删除原始图像,保留哈希或特征指纹也算保留数据,所谓“删除”有文字游戏嫌疑
  • 警方声明用词含糊,若只删除部分数据却声称“数据已删除”属于误导甚至撒谎
  • 摄像头部署次数少、每次仅数小时,且匹配名单只有约 400 人,阈值可能调得极高,故意追求零误报
  • 摄像头位置明显且有绕行路线,犯罪分子会避开,所以抓不到人很正常
  • 很多罪犯没有生物识别记录,或不在该区域活动,或使用车辆而非步行经过车站
  • 为了压低误报率,可能牺牲了识别率,导致大量漏报
  • 类似技术在其他地方也常被用于查过期车辆登记等小事,并非为了抓重犯

8. macOS Golden Gate 是一个 Bug 缠身的烂摊子。 (macOS Golden Gate Is a Buggy Mess) #

https://www.squareorbits.com/blog/2026/09/macos-golden-gate-is-a-buggy-mess/

macOS Golden Gate 被指存在大量 Bug,体验不佳。文章作者在两周日常使用中发现了诸多问题,包括界面元素对齐错乱(如 QuickTime 按钮、窗口平铺图标、文本和标题间距)、被遗忘的旧版图标(如 Siri 旧标志、网络应用图标不一致)、菜单栏架构变更导致第三方应用崩溃、系统设置搜索失灵、链接点击窗口短暂、窗口大小计算错误、控件消失等。此外还有细节瑕疵,如 Touch Bar 图标不匹配、截图圆角不一致、相机镜头形状怪异、菜单项缺少悬停反馈、Dock 文件夹点击行为不符合预期。作者承认部分问题属于刻意寻找,但认为在主打“精进”的版本中如此容易发现日常 Bug 令人失望,并猜测年度发布周期可能是原因,希望 Golden Gate 能像当年的 Snow Leopard 一样通过时间打磨完善。最后还提到一个严重 Bug:使用颜色窗口的吸管工具会导致系统死机,只能强制重启。


HN 热度 426 points | 评论 303 comments | 作者:SquareOrbits | 8 hours ago #

https://news.ycombinator.com/item?id=49894005

  • Golden Gate 在个人电脑上是严格改进,并修复了长期音频 bug
  • 修复了一些 bug 但新增很多愚蠢 bug,Mission Control 和 Finder 双击频繁出问题
  • Spotlight Launchpad 动画被跳过,怀念 Linux 桌面的精致
  • Finder 拖放失效,需要重启;也有观点认为这是老 bug,可杀 pboard 解决
  • 决定留在 Sequoia 跳过新系统,因为 Liquid Glass 丑;也有观点喜欢 Liquid Glass 但同意窗口移动抓取困难
  • Mission Control 快捷键失效,需 killall Dock 修复
  • 聚合音频设备输出重排问题
  • iOS 渲染卡顿,Android 反而流畅
  • 修复音频 bug 但破坏 Ableton
  • ‘buggy mess’ 是夸张,很多问题不是 Apple 的错
  • 居中 bug 体现细节缺失,影响信任;Apple 品牌依赖细节,软件滑落削弱品牌
  • Apple 应加大软件投入,也有观点反驳增加人手无用

9. 德里如何将电力损耗从 50% 降至 5% (How Delhi cut electricity loss from 50 to 5 percent) #

https://spectrum.ieee.org/delhi-electricity-loss

德里曾是电力供应极不稳定的城市,2002 年前后每天多次停电,电力损耗超过 50%,电网老化且缺乏问责。电气工程教授作者回忆了因停电影响家庭生活的亲身经历。

过去二十多年,德里政府和配电公司通过系统性改造,将电力损耗从 50% 以上降至 5% 至 6%,电网可靠性指数从约 70% 提升至 99.9% 以上,达到法国、比利时等发达国家水平。可靠电力促进了商业发展、电动车普及和居民生活质量提升。

文章认为德里的经验可为其他电网损耗严重的地区(如阿根廷、孟加拉国、肯尼亚、巴基斯坦等)提供借鉴。德里目前约 76% 的电力从外部购买,市内发电以天然气和可再生能源为主。


HN 热度 405 points | 评论 239 comments | 作者:rbanffy | 10 hours ago #

https://news.ycombinator.com/item?id=49892245

  • 德里过去电力供应极不稳定,每天多次停电,恢复供电时常伴随电压浪涌,需抢拔电器插头。
  • 办公室常备两套插座,一套接市电,一套接 UPS 供重要设备。
  • 所谓“load shedding”其实是计划性停电,报纸会提前刊登不同区域的停电时间表。
  • 计划停电对官员是“计划”,对消费者却是“突然”,如今停电会提前短信通知。
  • 停电可能因突发故障而主动切负荷,防止更大范围崩溃,未必是预先安排。
  • 高压线路(如 220KV)通常不参与拉闸限电,而 66KV 线路会;直接向发电公司购电且有合同保障的用户也不受影响。
  • 当时几乎每户都有柴油发电机,早期需手摇启动,后来才有按钮启动。
  • 除了停电,还有定时供水,需用桶储水冲厕所;有的城市每天早晚各供水一小时。
  • 古吉拉特邦和孟买在 2000 年代初没有这些水电问题。
  • 有人将古吉拉特邦的电力改善归功于莫迪,但也有人批评其政策存在宗教冲突问题。
  • 关于 2002 年古吉拉特邦骚乱,有观点认为穆斯林焚烧火车引发骚乱,政府已尽力快速平息;也有观点引用英国外交部报告称骚乱有“种族清洗”特征,莫迪负有责任,但该报告被印度政府视为殖民宣传。

10. Web 和移动对话式 AI 代理的隐私分析 (A Privacy Analysis of Web and Mobile Conversational AI Agents [pdf]) #

https://jorgegarciaherrero.com/wp-content/interactivos/20260916-Prompt-like-a-butterfly-sting-like-a-tracker-(clean).pdf

随着 OpenAI 等公司开始尝试广告商业模式,传统网页和移动端的追踪技术正被引入对话式 AI 服务。用户在 ChatGPT、Claude 等产品中输入的提示词、上传的文件和对话历史,往往包含非常敏感的个人或职业信息。如果这些内容被第三方追踪机构获取,风险远高于传统网页浏览数据。论文对九款主流对话式 AI 服务(ChatGPT、Claude、Grok、DeepSeek、Perplexity、Gemini、微软 Copilot、Mistral Le Chat、Meta AI)的网页端和 Android 端(八款有 App)做了系统性的隐私分析,核心问题包括:这些服务接入了多少第三方追踪、分析和广告服务;哪些对话相关数据被泄露给了第三方;以及 Cookie 同意选择、订阅层级和访问控制机制对这些泄露有何影响。

这项研究首次系统测量了消费级对话式 AI 中的第三方追踪,表明网页和移动端成熟的广告追踪基础设施已被完整移植到对话式 AI 中,用户的提示词、对话标题和链接等敏感产物被泄露给广告生态,并与持久化标识符绑定,部分对话甚至默认公开且事后被境外基础设施访问。这动摇了“对话式 AI 是用户与 AI 之间私密交流”的普遍认知,凸显出加强对话数据保护的监管与技术手段的紧迫性。研究团队已按负责任披露流程通知了相关服务商和欧洲数据保护机构。


HN 热度 400 points | 评论 126 comments | 作者:damaru2 | 14 hours ago #

https://news.ycombinator.com/item?id=49890226

  • ChatGPT 会向服务器发送未完成的提示,可能用于缓存预热,也可能用于跟踪用户的打字节奏、纠错风格和想法演变,甚至卖给广告商。
  • 隐私政策可能以技术细节为由,不将未完成提示视为“发送的内容”。
  • 企业可能利用法律定义漏洞(如 CCPA 前“用户数据协作”不算出售),OpenAI 对争议的回应就是例证。
  • 另一种可能是用于检测真人用户,防止绕过 API 定价。
  • Meta 高管的加入可能带来类似的数据行为。
  • 类似 Navier-Stokes 事件,OpenAI 可能用私人数据改进模型,因此开源模型应胜出,用户可自行运行。
  • 许多 AI 服务将 UUID URL 当作隐私保护,但这是安全通过模糊的反模式;Perplexity 会暴露完整对话,Claude artifacts 曾被搜索引擎索引。
  • 分享链接本身就有风险,用户应视为公开;聊天 UI 是雷区,不小心点击就会共享数据或被用于训练。
  • 有人质疑 UUID URL 不分享就安全,但浏览器历史明文存储,可能被恶意访问;也可能意外粘贴。
  • 如果设备程序能读历史,问题更大;但已有插件等权限可访问历史、剪贴板。
  • WhatsApp 强制要求完整相机权限,否则拒绝使用,不尊重隐私。
  • 有人将 UUID URL 比作密码,但密码不会放在 URL 中;cookie 虽随请求发送,但只发到指定域名,不会因历史或复制链接暴露。
  • 用辛普森比喻,用户都成了 Milhouse,向 AI 倾诉秘密。
  • 不平等侵蚀社会信任,世界变得敌对。

Hacker News 精彩评论及翻译 #

Everybody’s home. No one’s coming over #

https://news.ycombinator.com/item?id=49891690

Middle aged European here. I still regularly go to parties (dinner and otherwise) and I notice that there are two kinds of people: people who throw parties, and people who don’t. This sounds like a truism, but what I mean is: there are people who regularly throw a party and people who never do it.

I am solidly in the first category. I throw dinner parties, birthday parties, drinking parties, dance parties, midsummer parties, midwinter parties, game parties, etc. Yes, it costs time and money and is a lot of work. But what people (probably the ones that never bother) tend to forget is how unbelievably gratifying it is to get a bunch of people together, to feed them and to make them talk, laugh, dance, etc. Afterwards you are tired but also grateful and socially energized in a way that feels fundamental to my existence.

kieckerjan

作为欧洲中年人,我仍然经常参加派对(晚宴或其他形式的),我注意到有两种人:一种是举办派对的人,另一种是不举办的人。这听起来像是老生常谈,但我的意思是:有些人会定期举办派对,而有些人从来不做这种事。

我绝对属于第一类。我举办晚宴派对、生日派对、喝酒派对、跳舞派对、仲夏派对、仲冬派对、游戏派对等等。是的,这要花费时间和金钱,而且工作量很大。但人们(大概是那些从来懒得办的人)往往忘记的是,把一群人聚在一起,给他们吃的,让他们聊天、大笑、跳舞,这是多么令人难以置信的满足感。之后你虽然疲惫,但也很感恩,并且在社交上充满活力,那种感觉对我的存在来说根本不可或缺。


DraftKings is using AI to behaviorally target chro… #

https://news.ycombinator.com/item?id=49896224

ProPublica had one of their reports work with gambling addition experts to see how DraftKings would respond to someone presenting signs of a gambling problem. It’s a hell of a read, and makes it clear that this company is full of people with absolutely no ethics whatsoever.

https://www.propublica.org/article/draftkings-sports-gambling-problem-vip-fanduel

tedivm

ProPublica让他们的记者与赌博成瘾专家合作,测试DraftKings会如何回应一个表现出赌博问题迹象的人。这篇报道读起来震撼人心,让人清楚地看到这家公司里全是毫无道德底线的人。

https://www.propublica.org/article/draftkings-sports-gambling-problem-vip-fanduel


Does Reddit have an astroturfing problem? What the… #

https://news.ycombinator.com/item?id=49888226

The biggest problem I have with reddit is mods can slowly but systematically ban users who express unfavourable opinions, and over time, anyone casually browsing could mistakenly believe those views are unpopular, whereas in reality everyone with that view (everyone who spoke it, anyway) was banned.

To give a simple example, one video game franchise subreddit bans any negative discussion on the most recent title. Over 5-10 years, this shielded them from negative feedback. But the franchise has tanked because core users weren’t listened to, and they ended up making something nobody wanted.

nomilk

我对 Reddit 最大的意见是,版主可以缓慢但系统性地封禁表达不中听观点的用户。久而久之,任何随便浏览的人都会误以为这些观点不受欢迎,而实际上,持那种观点的人(至少是说过这种话的人)都被封了。

举个简单的例子:某个游戏系列的 subreddit 禁止讨论最新作的任何负面内容。在 5 到 10 年的时间里,这让他们免受负面反馈的影响。但这个系列最终扑了街,因为没有听取核心用户的意见,最后做出来的东西没人想要。


California farmers are struggling to sell grapes a… #

https://news.ycombinator.com/item?id=49886788

while young people are drinking less alcohol due to health and financial concerns

My observation is that gen-z spends less time socializing in real life, and drinking remains a social habit for the most part at a younger age. While they drink less, cannabis, vaping and psychedelics are on the rise.

It’s a nice claim to say they are more responsible, but it tells an incomplete story.

alexandre_m

虽然年轻人因健康和财务问题而减少饮酒

我的观察是,Z世代在现实生活中的社交时间更少,而在较年轻的年龄段,饮酒在很大程度上仍是一种社交习惯。虽然他们喝得少了,但大麻、电子烟和致幻剂的使用正在上升。

说他们更负责任是个不错的说法,但这只讲述了不完整的故事。


It’s Time to Investigate the AI Labs #

https://news.ycombinator.com/item?id=49884885

We must move past vague discussions of “AI” and instead isolate the specific types of systems that are creating problems.

This is absolutely correct and its surprising how rarely you see commenters in the media push to go into the specifics on this. AI is just matrix math and its what you connect that math to that matters, we should talk a little more about what we are willing to connect AI to and little less about how scary or capable the models appear.

jimmyjazz14

我们必须超越对“人工智能”的模糊讨论,转而聚焦于那些正在制造问题的具体系统类型。

这绝对正确,而且令人惊讶的是,媒体评论者很少推动深入探讨这一具体问题。人工智能不过是矩阵数学,重要的是你把这个数学连接到什么上。我们应该多谈谈我们愿意把AI连接到什么,少谈谈这些模型看起来多么可怕或多有能力。


Nvidia wants to put a watchdog chip next to every … #

https://news.ycombinator.com/item?id=49883801

What happens when we’re overrun by lizards?

No problem. We simply unleash wave after wave of Chinese needle snakes. They’ll wipe out the lizards.

But aren’t the snakes even worse?

Yes, but we’re prepared for that. We’ve lined up a fabulous type of gorilla that thrives on snake meat.

But then we’re stuck with gorillas!

No, that’s the beautiful part. When wintertime rolls around, the gorillas simply freeze to death.

tantalor

当我们被蜥蜴淹没时会怎样?

没问题。我们只需一波又一波地释放中国针蛇。它们会消灭蜥蜴。

但那些蛇不是更糟吗?

是的,但我们对此有准备。我们已经安排了一种极好的猩猩,它们以蛇肉为食。

但那样我们就会被猩猩缠住!

不,美妙之处就在这里。当冬天来临时,猩猩们直接就冻死了。


Everybody’s home. No one’s coming over #

https://news.ycombinator.com/item?id=49891819

It varies a lot depending on people and personality type. What’s energizing to you is very exhausting and unfun to others. Extraversion / introversion basically. I don’t like having many people over. 3 or 4 people who I know well is optimal for me.

Making a large party could be “type 2 fun” sometimes, ie exhausting and not very fun at the time, but satisfying to look back on as a kind of hard challenge I managed to accomplish, like climbing a cold mountain or so. But few are enough of those.

bonoboTP

因人而异,很大程度上取决于性格类型。让你感到充满活力的事,对别人来说可能非常消耗精力、毫无乐趣。基本上就是外向和内向的区别。我不喜欢邀请很多人来家里。三四个我熟悉的人对我来说是最理想的。

举办大型聚会有时可能是“第二类快乐”——也就是说,当时觉得很累、不太好玩,但事后回顾时,会有一种完成艰难挑战的满足感,就像爬了一座寒冷的山一样。但这种经历有几次就够了。


California farmers are struggling to sell grapes a… #

https://news.ycombinator.com/item?id=49890117

Same observation from Finland. Additionally, being even slightly drunk in front of children has become very no-no. I recently had a small gathering of other families with children at my home and I made the mistake of offering them some beers. Everyone declined and the looks I got were the same as if I had offered them crack cocaine.

I don’t think it’s all good, though, since a lot of social events that were previously facilitated by alcohol just disappear. Like who the fuck actually enjoys acquantainces’ children’s birthdays without a beer or two? Turns out people suck at socialising without alcohol, and if alcohol disappears, people just stay at home and play video games or something.

vjk800

来自芬兰的同样观察。此外,哪怕在孩子面前稍微有点醉意都变得非常禁忌。最近我在家举办了一个有孩子家庭的小型聚会,我犯了个错误,给他们递了几瓶啤酒。所有人都拒绝了,而且他们看我的眼神,就好像我递给他们的是可卡因一样。

不过我也不觉得这完全是好事,因为很多原本靠酒精助兴的社交活动就这么消失了。比如,谁他妈真的会享受熟人孩子的生日派对而不喝上一两瓶啤酒?事实证明,没有酒精人们根本不会社交,而一旦酒精消失了,大家就干脆待在家里打游戏或者干点别的什么。


US sanctions force The Netherlands off Microsoft a… #

https://news.ycombinator.com/item?id=49892118

Several International Criminal Court (ICC) judges have been unable to access their bank accounts or receive routine salary payments and financial transfers due to financial blockages triggered by United States sanctions. In the country where they live

guidoiaquinti

因美国制裁引发的金融封锁,数名国际刑事法院(ICC)法官无法访问其银行账户,也无法接收常规工资支付和金融转账——在他们所居国家。


Kids turned low-traffic NPR Spotify comments into … #

https://news.ycombinator.com/item?id=49880840

Back in ~2001 I ran a fairly popular blog commenting system - back then most blogs didn’t have built-in comments, so I offered javascript embeds to add them to posts.

One day performance started to go down rapidly, and within a few days my host got in touch about unusual CPU usage.

I tracked it down to a series of random blogger.com blog posts with colossal comment threads measuring in the thousands. Each post only got comments for a single day, and all of the comments were in Japanese. The blog owners seemed very confused.

Turns out Japanese schoolkids figured this trick out 25 years ago.

jonty

大约在2001年,我运行着一个相当流行的博客评论系统——那时候大多数博客没有内置评论功能,所以我提供JavaScript嵌入来给文章添加评论。

有一天性能开始急剧下降,没过几天我的主机商就联系我,说有异常的CPU使用。

我追踪到一系列随机的blogger.com博客文章,上面有巨大的评论线程,数量达到数千条。每篇文章只在一天内收到评论,而且所有评论都是日语的。博客所有者看起来非常困惑。

结果发现,日本学生早在25年前就发现了这个把戏。


Everybody’s home. No one’s coming over #

https://news.ycombinator.com/item?id=49892115

I wonder if the cultural existence of the ‘introvert vs extrovert’ idea has reinforced this to a degree. I’m too young to know, but I doubt this was a discussion in the 80s. I’m also not too sure it’s a good thing. I’ve seen introversion used as an excuse to hermit; extroversion as the sole reason to use drugs.

We put limits on ourselves psychologically in all sorts of ways, and we follow the ones we believe. There’s a study that showed people who believe willpower is finite have finite willpower. I thought “well obviously, if you had finite willpower you’d know because you’d run out”. Maybe we do just think too much?

If I don’t feel like running and I go running, about two thirds of the time I feel like running after a few K. It’s the same socially. The goal of introspection shouldn’t be to freeze in a minute now.

ddek

我在想,“内向者与外向者”这个观念在文化中的存在是否在某种程度上强化了这一点。我太年轻不知道,但我怀疑80年代是否有人讨论这个。我也不太确定这是好事。我见过有人把内向当作隐居的借口;把外向当作吸毒的唯一理由。

我们会以各种方式在心理上给自己设限,而且我们会遵循自己相信的那些限制。有研究表明,认为意志力有限的人,其意志力就是有限的。我当时想:“嗯,显然如此,如果你的意志力有限,你会知道,因为你会用完。”也许我们确实想得太多了?

如果我不想跑步但还是去跑了,大约有三分之二的时候,跑了几公里后我就会想跑了。社交上也是一样。内省的目标不应该是把自己定格在当下这一刻。


Sonnet 5.5 #

https://news.ycombinator.com/item?id=49882083

Probably a first world problem, but with Opus 5.5’s efficiency, the limits on the 5x plan are simply sufficient for my everyday work, even when running 2-3 sessions at a time. So I wonder when I would use Sonnet 5.5.

More concurrency than that isn’t really practical for me if I want to retain some semblance of understanding. Perhaps it’s different for purely web app or frontend tasks, where the outcome is more relevant than the process, I don’t have much experience there (and also don’t want to belittle these domains, I might be underestimating their complexity).

So surprisingly, my own work is at least for the time being almost saturated by the model capabilities. I am not sure how I’d scale from here. Sure I could run all requests at max effort to burn tokens for the sake of it, but that can’t be it. And for many tasks, I am not really able to define so clear cut success criteria or self-verification loops that I could benefit from letting an agent (or a fleet thereof) autonomously run for a day.

So I realize it’s a skill issue on my side, but I can’t be the only one. I wonder if there is a limit to token demand, at least short term. Feels like either they accelerate to AGI and RSI, where the AI can find uses for token, or things might plateau at some point.

Note I don’t think this because I’m an AGI skeptic or think there’s a ceiling to intelligence, but there might simply be a valley of economic hardship for the companies where the supply of tokens outpaces the demand, due to a lack of ideas of what to do with them. And this might slow down the funding enough that they never reach escape velocity with the training run scaling. But we’ll see.

Sol-

可能是个“第一世界”问题,但以Opus 5.5的效率,5x计划的限额对于我的日常工作来说已经足够了,即使同时运行2-3个会话也绰绰有余。所以我想知道什么时候才会用到Sonnet 5.5。

如果我还想保持对工作的某种理解,那么更高的并发对我来说其实不太实际。也许对于纯Web应用或前端任务来说情况不同,那里结果比过程更重要,但我在那些领域没什么经验(也不想贬低这些领域,我可能低估了它们的复杂性)。

所以出乎意料的是,至少目前,我自己的工作几乎已经被模型能力完全覆盖了。我不确定从这里该如何扩展。当然,我可以把所有请求都设为最大努力来烧掉代币,但那样没什么意义。而且对于很多任务,我其实无法定义足够清晰的成功标准或自我验证循环,从而能够受益于让一个代理(或一群代理)自主运行一整天。

所以我意识到这是我这边的技能问题,但我肯定不是唯一一个。我想知道代币需求是否存在上限,至少在短期内。感觉要么他们加速走向AGI和RSI,让AI自己找到代币的用途,要么事情在某个点会趋于平稳。

注意,我这么想不是因为我是AGI怀疑者或认为智力有天花板,而是因为可能存在一个经济困难的谷底:由于缺乏使用代币的想法,代币供应超过了需求。这可能会减缓资金流入,使他们永远无法在训练规模扩展上达到逃逸速度。但走着瞧吧。


America.gov #

https://news.ycombinator.com/item?id=49895289

OK, there’s a lot of negative comments here, but this is a great idea at a high level. It really is hard to figure out where to do a thing and it’s also very easy to get phished. If they can figure out how to help people get all the services they’re eligible for that’ll be an amazing improvement for the people.

maherbeg

好吧,这里有很多负面评论,但从宏观层面看,这是一个很棒的想法。确实很难搞清楚该去哪里做某件事,而且也很容易被钓鱼。如果他们能想办法帮助人们获得所有他们有资格享受的服务,那对人们来说将是一个巨大的改善。


Updated Google Maps shows destruction of the city … #

https://news.ycombinator.com/item?id=49881405

Its really telling to see the destruction limited to where the structures used to be rather than to all of the surrounding green spaces. If the destruction of civilian dwellings was purely an accident you’d expect to see the destruction spread evenly over the area. Instead it looks much more like a prolonged set of surgical strikes to destroy the buildings while preserving as much of the surrounding areas as possible.

For a great example of this, look at this pin https://maps.app.goo.gl/ZcMbdFcx87PrqoYNA

And here’s a pin of where the farms were spared https://maps.app.goo.gl/iZbbTH4iH27FCz4s9

bognition

看到破坏仅限于原本建筑所在的位置,而不是周围所有的绿地,这很能说明问题。如果摧毁平民住宅纯属意外,你会预期破坏会均匀地分布在整个区域内。然而,实际情况看起来更像是经过一系列外科手术式的定点打击,目的是摧毁建筑,同时尽可能保全周边区域。

一个很好的例子是,看看这个定位:https://maps.app.goo.gl/ZcMbdFcx87PrqoYNA

还有一个定位显示了幸存的农田:https://maps.app.goo.gl/iZbbTH4iH27FCz4s9


Updated Google Maps shows destruction of the city … #

https://news.ycombinator.com/item?id=49887756

There are Street View photos that look like they were taken from someone driving down one of the side streets so you can pretty much walk on it. You can see apartment buildings, local shops, people going about their day… It’s heart-wrenching to contrast that life with the current aerial view, with nothing but rubble and destruction.

https://www.google.com/maps/place/31%C2%B016'58.6%22N+34%C2%B019'54.4%22E/@31.3100639,34.2438144,6a,40y,257.13h,87.07t/data=!3m6!1e1!3m4!1sCIHM0ogKEICAgIDe8_W9_QE!2e10!7i1080!8i1920!4m4!3m3!8m2!3d31.282936!4d34.331779?entry=ttu&g_ep=EgoyMDI2MDkyMy4wIKXMDSoASAFQAw%3D%3D

fcortes

有些街景照片看起来像是有人沿着某条小路开车时拍摄的,所以你几乎可以步行其间。你能看到公寓楼、当地小店、人们日常出行……将那种生活与现在只有瓦砾和毁灭的航拍画面相比,实在令人心碎。


When did Google get so weird? #

https://news.ycombinator.com/item?id=49871299

This isnt wierd. Its disturbing. I believe that the tech industry is geniunely trying to scare and disorient the public into thinking they are the only thing standing between them and some evil AI overlord which is obviously just the tech industry itself and a pile of poor trained LLMs.

I believe this “fear” factor they are driving they believe will increase their credibility when they call LLMs AI and is a con towards convincing everyone they have reached AGI. Its definitely marketing preparation so that when they do claim AGI we will believe it without question. (or else!)

If these folks didnt have so much money it would be something to laught at, but its now becoming geniunely disturbing and Im starting to think that the folks running these shops are probably flirting with or experiencing extended mental illness.

I would feel sorry for them if I cared. I dont care. The tech industry is a joke and we are all going to be ashamed to be a part of it by the time this is over. Shut it down.

BatchJob

这不奇怪,这令人不安。我相信科技行业真的在试图吓唬和迷惑公众,让公众以为他们是唯一能阻止某个邪恶AI霸主的力量,而那个所谓霸主显然就是科技行业自己,外加一堆训练不佳的大语言模型。

我相信他们推动的这种“恐惧”因素,他们认为这会增加他们把大语言模型称为AI时的可信度,并且是一场骗局,旨在说服所有人他们已经达到了AGI。这绝对是营销铺垫,以便当他们真的声称实现AGI时,我们会毫不犹豫地相信。(否则的话!)

如果这些人没有那么多钱,这或许还能让人一笑置之,但现在这真的变得令人不安了,我开始觉得运营这些公司的人可能正在跟精神疾病调情,或者已经经历了长期的精神问题。

如果我在乎的话,我会为他们感到难过。我不在乎。科技行业就是个笑话,等这一切结束的时候,我们都会为自己是这个行业的一员而感到羞耻。把它关掉吧。


GLM-5.3 and the spread of advanced cyber capabilit… #

https://news.ycombinator.com/item?id=49899905

They’re advertising GLM for free.

Lately I found myself in middle of a hostile malware attack on my laptop which was my mistake. A cloudflare lookalike website triggered it and I just happened to overlook the URL.

In panic I headed to Claude and first request was denied. Not looking beyond scope.

Desperate - I fired opencode with DeepSeek v4 Flash (not even 4.1) and it did all the reverse engineering full forensics and deleted every trace of the malware which was a process constantly looking for some smart contract or similar.

So no, GLM 5.3 is fine. Thank you for the free advertisement.

wg0

他们在免费宣传GLM。

最近我因为自己的失误,笔记本电脑遭到了一次恶意攻击。一个伪装成Cloudflare的网站触发了攻击,而我不巧忽略了URL。

慌乱中我转向Claude,但第一个请求被拒绝了。没有超出范围去查看。

走投无路之下——我启动了opencode,搭配DeepSeek v4 Flash(甚至不是4.1),它完成了所有的逆向工程、完整的取证分析,并删除了恶意软件的每一个痕迹,那是一个不断寻找某种智能合约或类似东西的进程。

所以,不,GLM 5.3没问题。谢谢你们的免费广告。


Sonnet 5.5 #

https://news.ycombinator.com/item?id=49884509

I find that “vibe coders” (that is, people who do not know anything about programming, but nevertheless produce useful tools for themselves and others) are using a lot more tokens than we do as programmers.

I think this is partially because we’re still attached to pre-LLM notions of architecture, good design and code quality (which are still important, but maybe less important than they once were and that we think they are), partially because their projects are in a messy state, so models have to work around the technical dept.

They’re essentially trading off programmer time for LLM time (which is a good trade financially speaking).

miki123211

我发现,“vibe coders”(即那些完全不懂编程,却仍能为自己和他人制作出实用工具的人)使用的token数量比我们这些程序员多得多。

我认为部分原因是,我们仍然执着于前LLM时代的架构、良好设计和代码质量观念(这些依然重要,但可能没有过去以及我们想象中那么重要了),部分原因是他们的项目处于混乱状态,因此模型必须绕开技术债务。

他们本质上是用程序员的时间来换取LLM的时间(从财务角度看,这是一笔划算的交易)。