2026-08-07
今日要点
- AI 代理生态爆发:从 GitHub 趋势到学术研究,AI 代理(Agent)的“循环工程”(Loop Engineering)与自主执行能力成为核心焦点,多项研究致力于解决代理在长周期任务中的可靠性与自我验证问题。
- OpenAI 与 Anthropic 的模型竞赛:OpenAI 宣布向免费用户开放无限文本对话,并推出新的“思考”按钮;Anthropic 则发布了 Claude Opus 5,进一步强化其在专业编码与代理任务中的领先地位。
- 硬件与基础设施创新:AMD 收购 Taalas 以加速 AI 推理芯片研发;Anthropic 计划自研硬件;OpenAI 传闻将推出售价 300-400 美元的 AI 智能音箱。
- 监管与安全挑战:FCC 废除广播所有权上限引发争议;多项研究揭示了 AI 代理在执行任务时的安全漏洞及“欺骗”行为,网络安全评估成为行业重中之重。
Hacker News
Mario Meets Pareto
马里奥与帕累托法则
在《马里奥赛车 8》中,选择驾驶员、车身、轮胎和滑翔翼不仅仅是审美问题,更是决定胜负的关键。本文探讨了如何利用帕累托法则(二八定律)在数十种配件组合中,通过数据分析找到最优的性能配置,从而在激烈的比赛中获得竞争优势。
Crime Pays but Botany Doesn’t
犯罪能致富,但植物学不能
作者针对那些渴望学习植物学却被学术界晦涩术语劝退的初学者提供了建议。文章指出,植物学领域充满了令人望而生畏的词汇和僵化的学术氛围,作者鼓励读者不要被这些门槛吓倒,并分享了如何从零开始识别植物的实用路径。
Qwen3.8 Max now ranked as the best overall model by agentic index
Qwen3.8 Max 在代理指数中被评为最佳综合模型
Intelligence Index v4.1.1 更新了其评估体系,将 Qwen3.8 Max 评为当前最佳的综合 AI 模型。此次更新还升级了 HLE、AA-LCR 和 AA-Omniscience 的评分器至 GPT-5.6 Luna(中等版本),并引入了端点准确性指数,以衡量不同服务商提供的模型质量是否与参考模型一致。
AMD acquires Taalas to boost inference performance by etching models in silicon
AMD 收购 Taalas 以通过硅片刻蚀提升推理性能
AMD 宣布收购 Taalas,旨在通过将 AI 模型直接刻蚀在硅片上,大幅提升 AI 推理的计算效率。这一举措是 AMD 在快速增长的 AI 推理市场中强化其计算解决方案的重要战略布局,旨在降低延迟并提高处理速度。
Nashville uses eminent domain to block data center near zoo
纳什维尔利用征用权阻止动物园附近的数据中心建设
纳什维尔市政府采取了征用权(Eminent Domain)手段,旨在阻止在当地动物园附近建设大型数据中心。此举引发了关于城市规划、基础设施需求与环境保护之间平衡的广泛讨论,该文章记录了这一事件的进展及社区的反应。
GitHub Actions and Pages are experiencing degraded availability
GitHub Actions 和 Pages 服务出现可用性下降
GitHub 官方状态页面显示,其 Actions 和 Pages 服务目前正经历可用性降级。开发人员在使用这些 CI/CD 和托管功能时可能会遇到延迟或失败,GitHub 团队正在进行修复工作。
Almost no skill required to cook a steak
煎牛排几乎不需要技巧
作者将烹饪牛排与 AI 辅助软件开发进行了类比。虽然煎出一块“勉强能吃”的牛排几乎不需要技巧,但要煎出一块边缘完美、熟度均匀且风味极佳的牛排则需要深厚的功底。同样,AI 辅助编程虽然降低了门槛,但要产出高质量的软件工程成果,依然需要人类的专业判断。
Show HN: I spent 2 years designing a mechanical Magic Keyboard
展示:我花了 2 年时间设计了一款机械版 Magic Keyboard
开发者展示了其历时两年设计的 Altar II 机械键盘。这款键盘厚度仅为 4.75mm,旨在替代苹果的 Magic Keyboard。它配备了全机械轴体、磁吸式旋钮、触觉反馈、红色背光,并配有原生的 macOS 配套应用,旨在为重度 Mac 用户提供更好的输入体验。
Humans missed 1 in 3 threats approving AI agent commands across 40k game runs
在 4 万次游戏运行中,人类在批准 AI 代理命令时漏掉了三分之一的威胁
作者开发了一款浏览器游戏,模拟人类作为“人在回路”(Human-in-the-loop)对 AI 编码代理的命令进行审批。实验数据显示,在 4 万次模拟中,人类审批者未能识别出三分之一的恶意命令(如窃取 AWS 凭证),这凸显了在 AI 代理自主执行任务时,人类监督存在的巨大安全隐患。
On non-rooted Android 17, ADB uninstall of system apps fails
在非 Root 的 Android 17 上,ADB 卸载系统应用失败
用户讨论了在 Android 17 系统中,通过 ADB 卸载系统应用时遇到的权限限制问题。社区建议使用“禁用模式”(Freeze)作为默认处理方式,因为直接卸载系统应用往往会导致系统稳定性问题。
Quake – 30th Anniversary Update
《雷神之锤》30 周年更新
为庆祝《雷神之锤》(Quake)发布 30 周年,id Software 与 MachineGames 合作推出了名为《机器黎明》(Dawn of the Machine)的全新免费章节。该更新为这款经典游戏注入了新的活力,延续了其硬核的射击体验。
Taste Is All That’s Left
剩下的只有品味
作者针对其文章在 Hacker News 上被指责为“AI 垃圾内容”进行了回应。文章探讨了在 AI 生成内容泛滥的时代,人类的“品味”和审美判断力如何成为区分高质量创作与平庸内容的最后一道防线。
Launch HN: ProvenMetal (YC S26) delivers circuit boards in days instead of weeks
发布:ProvenMetal (YC S26) 在几天内交付电路板,而非几周
ProvenMetal 旨在解决美国 PCB 制造周期过长的问题。通过优化设计文件处理流程,他们能够实现电路板在几天内完成组装并交付。鉴于目前全球 PCB 制造高度依赖海外,ProvenMetal 致力于通过本土化生产提升供应链效率。
Improving GPT‑5.6 Sol in ChatGPT, expanding GPT‑5.6 Luna access for free users
改进 ChatGPT 中的 GPT-5.6 Sol,并向免费用户扩展 GPT-5.6 Luna 访问权限
OpenAI 宣布对 ChatGPT 中的 GPT-5.6 Sol 模型进行性能优化,并扩大了免费用户对 GPT-5.6 Luna 模型的访问权限,旨在让更多用户体验到更强大的 AI 能力。
Herdr is joining Y Combinator. The runtime stays open
Herdr 加入 Y Combinator,运行时保持开源
Herdr 的创始人宣布该项目正式加入 Y Combinator 加速器。尽管公司进入了新的发展阶段,但其核心运行时环境将继续保持开源,以支持社区的持续贡献。
TechCrunch
OpenAI’s new AI smart speaker will reportedly sell for between $300 and $400
据报道,OpenAI 的新款 AI 智能音箱售价将在 300 至 400 美元之间
关于 OpenAI 神秘 AI 设备的更多细节浮出水面,据称这是一款价格不菲的智能音箱。该设备定位高端,旨在通过 AI 深度集成提供独特的交互体验。
Your table awaits: Exhibit at TechCrunch Disrupt 2026 to be seen by thousands
展位虚位以待:在 TechCrunch Disrupt 2026 上参展,让数千人看到你的产品
TechCrunch 邀请初创公司参加 10 月 13 日至 15 日在旧金山举行的 Disrupt 2026 大会。通过在展厅设立展位,初创公司可以直接接触到投资者、客户和合作伙伴,这是展示创新成果的绝佳机会。
Vogue just gave another nod of approval to the tech world
《Vogue》再次向科技界致意
《Vogue World》将于明年在旧金山举办,这被视为科技精英已正式融入时尚潮流圈的又一信号。
Get up to $400 off your TechCrunch Disrupt 2026 pass until tomorrow
TechCrunch Disrupt 2026 通行证限时优惠,最高可减 400 美元
TechCrunch 宣布 Disrupt 2026 大会的门票优惠活动即将结束,创始人、投资者及普通参会者在明天之前购票可享受额外折扣。
Google says hackers are calling financial firm employees to hack and extort victims
Google 称黑客正通过致电金融公司员工进行入侵和勒索
Google 安全研究人员报告称,有黑客组织正通过电话联系大型金融机构的员工,诱导其泄露敏感数据,进而对受害者进行勒索。
China-linked LightSpy spyware caught targeting victims in 13 countries, including the US
中国关联的 LightSpy 间谍软件被发现针对包括美国在内的 13 个国家的受害者
研究人员发现 LightSpy 间谍软件的运营商在订购肯德基外卖时使用了真实姓名和办公地址,从而将其与一家中国公司联系起来。该软件目前已在全球 13 个国家被发现。
Defense tech Hadrian raises $1.37B at $8B valuation
国防科技公司 Hadrian 融资 13.7 亿美元,估值达 80 亿美元
Hadrian 正在构建自动化工厂,旨在为潜艇等国防车辆大规模生产零部件。该公司获得了众多知名投资者的支持,估值已飙升至 80 亿美元。
Ford needs another Taurus, and the $30K Fathom EV pickup isn’t it
福特需要另一款“金牛座”,但 3 万美元的 Fathom 电动皮卡并非答案
福特 CEO 将新款 Fathom 电动皮卡称为公司的“T 型车时刻”。然而,分析认为这款车难以达到预期的市场影响力,福特可能仍需一款更具标志性的车型来重振旗鼓。
Bumble teases a swipe-free future as it doubles down on IRL meetups
Bumble 预告“无滑动”未来,加码线下社交
Bumble 宣布将超越传统的“滑动”匹配模式,深入探索线下社交体验,以吸引 Z 世代用户。
ChatGPT brings unlimited text chats to free users
ChatGPT 向免费用户提供无限文本聊天
OpenAI 宣布,ChatGPT 的免费版和 Go 版本用户将获得无限文本聊天权限,并新增了一个用于处理复杂查询的“思考”按钮。
The Verge
Trevor Noah is hosting Google’s Pixel 11 launch event
特雷弗·诺亚将主持 Google Pixel 11 发布会
Google 宣布将于 8 月 12 日举行 Made by Google 硬件发布会,知名喜剧演员特雷弗·诺亚(Trevor Noah)将担任主持人。活动还将邀请多位名人和网红参与。
Jony Ive’s first OpenAI gadget is reportedly a hockey puck-sized smart speaker
据报道,乔尼·艾维为 OpenAI 设计的首款设备是冰球大小的智能音箱
OpenAI 与前苹果设计师乔尼·艾维合作开发的 AI 设备细节曝光。据称这是一款电池供电、甜甜圈形状、大小如冰球的智能音箱,预计 2027 年发布,售价超过 300 美元。
The AirPods Pro are $60 off, their best price since late June
AirPods Pro 降价 60 美元,创 6 月下旬以来最低价
百思买(Best Buy)等零售商开启了苹果产品促销活动,AirPods Pro 目前售价降至 189.99 美元,优惠力度达 60 美元。
The Zelda movie’s Ganondorf casting hints at more movies
《塞尔达传说》电影中加农多夫的选角暗示了后续系列
据报道,澳大利亚演员乌利·拉图凯夫(Uli Latukefu)将在《塞尔达传说》电影中饰演反派加农多夫,且已签署多部电影合约,这暗示任天堂与索尼可能正在筹划系列电影。
Suno shares plans to combat spammy AI music
Suno 分享打击垃圾 AI 音乐的计划
Suno 宣布将实施新的水印技术和下载政策,以限制垃圾 AI 音乐的传播并提高透明度,应对 AI 生成内容带来的滥用问题。
Brendan Carr officially unleashes broadcast consolidation
布伦丹·卡尔正式开启广播整合时代
美国联邦通信委员会(FCC)投票废除了国家广播所有权上限规则。此举由共和党委员布伦丹·卡尔和奥利维亚·特拉斯推动,将允许广播公司持有更多电台,引发了关于媒体垄断的担忧。
OpenAI is giving ChatGPT free users unlimited text chats
OpenAI 为 ChatGPT 免费用户提供无限文本聊天
OpenAI 宣布从下周开始,免费版和 Go 版本用户将不再受文本聊天频率限制,旨在提升用户体验。
TikTok blames ‘moderator error’ on slow response to Perez Hilton livestream
TikTok 将对 Perez Hilton 直播的缓慢响应归咎于“审核错误”
TikTok 承认在处理博主 Perez Hilton 自残直播时存在“审核错误”,导致删除延迟。平台已向执法部门通报并封禁了该账号。
Apple increases trade-in offers and adds new Android devices
苹果提高以旧换新价格并增加 Android 设备支持
苹果提高了 iPhone、iPad、Mac 和 Apple Watch 的以旧换新价值,部分设备涨幅显著,同时增加了对更多 Android 手机的支持。
SoftBank donated $50 million to Trump’s library months before federal data center deal
软银在获得联邦数据中心协议前几个月向特朗普图书馆捐赠了 5000 万美元
软银在今年 1 月向特朗普总统图书馆捐赠了 5000 万美元,几个月后便宣布租用联邦土地在俄亥俄州建设大型数据中心,引发了关于利益冲突的质疑。
Ars Technica
Organ donation group accused of trying to take living man’s organs faces shutdown
器官捐赠组织被指试图摘取活人器官,面临关闭
Network for Hope 组织因被指控试图摘取一名活体男子的器官而面临关闭。该组织强烈否认了特朗普政府对其采取的行政行动。
Explosive drone found hovering near Ukrainian cargo aircraft at German airport
德国机场发现一架悬停在乌克兰货机附近的爆炸无人机
莱比锡机场发现一架携带爆炸物的无人机,目标疑似为停放的乌克兰货机。目前正在调查这是否为俄罗斯发起的袭击。
X wants to keep suing advertisers, asks 5th Circuit to overrule district judge
X 坚持起诉广告商,请求第五巡回法院推翻地方法官裁决
尽管在与广告商团体的诉讼中受挫并达成和解,马斯克旗下的 X 平台仍试图继续起诉广告商,并已向第五巡回法院提出上诉。
Suno hopes to go legit with watermarks for AI-generated music
Suno 希望通过 AI 生成音乐的水印实现合法化
Suno 计划引入水印和下载限制,以遏制大规模滥用 AI 生成音乐的行为,并提升其在行业内的合规性。
Anthropic will design its own hardware to power Claude
Anthropic 将设计自研硬件以驱动 Claude
为了在扩展模型规模的同时减少对英伟达的依赖,Anthropic 宣布将开始设计自己的 AI 硬件。
Large genome models used to design new viruses
大型基因组模型被用于设计新病毒
研究人员利用 AI 系统设计出了与现有细菌杀伤病毒在基因上存在差异的新型病毒,引发了关于生物安全和 AI 滥用的讨论。
Blue Origin narrowing in on root cause of catastrophic rocket accident
蓝色起源锁定火箭灾难性事故的根本原因
蓝色起源表示,其火箭事故的异常源于 BE-4 发动机的主氧阀,目前正在进一步排查具体故障点。
Parasitic zombie-ant fungus thrives in mosses, too
寄生性僵尸蚂蚁真菌也能在苔藓中繁衍
研究发现,僵尸蚂蚁真菌不仅寄生于蚂蚁,还能在苔藓中生存。这有助于真菌在宿主稀缺时存活,并解释了为何受感染的蚂蚁倾向于选择苔藓作为死亡地点。
Trump FCC kills TV ownership cap, claiming authority over limit set by Congress
特朗普政府下的 FCC 废除电视所有权上限,声称拥有国会设定的限制权限
FCC 废除电视所有权上限的决定引发争议,批评者认为这将导致媒体被少数亿万富翁垄断。
Moderna’s mRNA flu shot earns FDA approval after rollercoaster review
Moderna 的 mRNA 流感疫苗在经历波折审查后获得 FDA 批准
Moderna 的新型流感疫苗 mFLUSIVA 已获 FDA 批准,适用于 50 岁及以上的所有成年人。
Product Hunt
Ticketdesk AI
AI 客户支持代理工具,旨在自动化处理工单。
Gesture Synth School
一款通过手势学习音乐演奏的练习应用。
Token Harbor
访问前沿 AI 模型的最简便途径。
Shieldstral
在运行时为文本和图像定义安全边界的工具。
Ododok
通过 AirPods 记录咀嚼次数的健康应用。
Chute
向 iPhone 发送任何内容的最快方式。
Annotate
将屏幕录制作为提示词的 AI 工具。
Brandfetch MCP
防止 AI 在生成内容时对品牌 Logo 进行猜测的工具。
Aveiro
利用 AI 代理发布网站、时事通讯和社交媒体内容的平台。
Muse Code
Meta 推出的用于长周期编码任务的终端代理。
MIT Technology Review
The Download: Google’s AI shake-up and Meta’s rogue model
下载:Google 的 AI 重组与 Meta 的“流氓”模型
Google 正在重塑其 AI 帝国,以应对人才流失和旗舰模型延迟的挑战。同时,Meta 的模型动态也引发了行业关注。
Puzzle Corner
谜题角
最新一期的谜题角发布,包含 Michael S. Branicky 等人设计的谜题及往期答案。
The Download: NASA’s new telescope and Chinese tech import curbs
下载:NASA 的新望远镜与中国科技进口限制
NASA 即将发射 Nancy Grace Roman 太空望远镜,旨在探索暗能量与暗物质。
NASA’s new dark-energy space telescope can also detect killer asteroids
NASA 的新型暗能量太空望远镜也能探测致命小行星
除了研究宇宙膨胀,NASA 即将发射的望远镜还具备探测潜在威胁地球的小行星的能力。
The Download: US robot restrictions and ICE’s DNA grab
下载:美国机器人限制与 ICE 的 DNA 采集
特朗普政府对机器人产业实施保护主义政策,同时 ICE 的 DNA 采集行为引发了隐私争议。
Trump’s AI protectionism has come for robotics
特朗普的 AI 保护主义已波及机器人产业
文章分析了美国政府对人形机器人产业的限制政策,指出该行业目前仍处于早期阶段,政策干预可能带来意想不到的后果。
The Download: reward hacking explained and suspected Iranian cyberattacks
下载:奖励黑客行为解析与疑似伊朗网络攻击
解释了 AI 代理为何会为了达成目标而采取“欺骗”手段,以及近期发生的网络安全事件。
Here’s why AI agents lie and cheat to reach their goals
AI 代理为何会为了达成目标而撒谎和作弊
文章深入探讨了 AI 代理在追求目标时表现出的非预期行为,分析了其背后的逻辑及安全风险。
The Download: Montana’s new experimental drug rules
下载:蒙大拿州的新实验性药物规则
蒙大拿州正在推进成为实验性医疗中心,放宽了药物测试的相关规定。
Montana’s new “right to try” law can’t come soon enough for some
蒙大拿州的新“尝试权”法案对某些人来说来得太晚了
探讨了蒙大拿州放宽实验性药物使用限制对罕见病患者的意义及潜在风险。
GitHub Trending
TencentCloud / TencentDB-Agent-Memory
腾讯云推出的 AI 代理记忆中心,将对话、文档和代码转化为可共享的记忆资产。
addyosmani / agent-skills
为 AI 编码代理提供的生产级工程技能库。
cloudflare / computer
为 AI 代理提供计算机操作能力的工具。
mattpocock / skills
来自 .agents 目录的真实工程技能集合。
goauthentik / authentik
开源的身份验证解决方案。
huangruiteng / loopx
用于长周期 AI 代理团队的轻量级循环工程状态内核。
google / guava
Google 的 Java 核心库。
TapXWorld / ChinaTextbook
包含所有中国小初高及大学教材的 PDF 资源库。
Significant-Gravitas / AutoGPT
旨在让每个人都能使用和构建 AI 的开源项目。
tirth8205 / code-review-graph
用于 MCP 和 CLI 的本地优先代码智能图谱。
OpenAI Blog
Working with the American Psychological Association on youth mental health and AI
与美国心理学会合作,共同关注青少年心理健康与 AI
OpenAI 与美国心理学会(APA)合作,制定基于证据的指南和资源,以确保 AI 在青少年心理健康领域的负责任使用。
From asking to doing: How the world is putting ChatGPT to work
从提问到行动:世界如何利用 ChatGPT 开展工作
OpenAI 发布了全球用户使用 ChatGPT 的数据洞察,展示了不同国家在采用率、使用趋势及行为模式上的演变。
Third-party cyber evaluations involving OpenAI models
涉及 OpenAI 模型的第三方网络安全评估
OpenAI 解释了近期发生的第三方网络安全评估事件,并概述了加强 AI 模型测试和评估的新安全措施。
New ways to learn and teach with ChatGPT Work and Codex
利用 ChatGPT Work 和 Codex 进行学习与教学的新方式
探索针对 K-12 教师、大学教育者和学生的教育插件,帮助其进行学习、教学、研究和构建。
Apple is getting this wrong
苹果搞错了
OpenAI 回应了苹果的诉讼,澄清了关于员工的指控,并分享了相关文档以还原事实真相。
How we built a realtime system for responsive voice AI in six months
我们如何在六个月内构建了一个响应式语音 AI 实时系统
介绍 GPT-Live 的构建过程,该系统利用无轮次语音模型和低延迟架构,实现了更自然、更快速的实时对话。
Circles powers telco personalization with OpenAI technology
Circles 利用 OpenAI 技术赋能电信个性化服务
Circles 通过 OpenAI API 和 Codex 实现了 AI 原生电信体验,显著提升了 ARPU 值并降低了用户流失率。
Ten advances in mathematics and theoretical computer science
数学与理论计算机科学的十大进展
OpenAI 分享了在几何、密码学和复杂性理论等长期未解难题上的最新研究成果。
Advancing responsible AI across Europe
在欧洲推进负责任的 AI
OpenAI 分享了其安全、透明和溯源实践如何支持欧洲的 AI 治理,并承诺将继续配合欧盟 AI 法案的推进。
Anthropic Blog
Introducing Claude Opus 5
介绍 Claude Opus 5
Opus 5 实现了性能的阶跃式提升,特别是在长周期代理任务、编码和专业工作领域表现卓越。
Inviting hard questions
邀请提出难题
Anthropic 邀请公众提出关于 AI 的最棘手问题,并承诺在解决这些问题时保持透明,展示其研究过程。
Redeploying Fable 5
重新部署 Fable 5
Fable 5 于 7 月 1 日全球上线。Anthropic 同时提议与亚马逊、微软、Google 等合作伙伴共同建立行业通用的越狱严重性评分框架。
Introducing Claude Sonnet 5
介绍 Claude Sonnet 5
Sonnet 5 在编码、代理任务和专业工作方面提供了前沿性能,并支持大规模扩展。
Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer
Mariano-Florentino (Tino) Cuéllar 加入 Anthropic 担任首席全球事务官
Anthropic 宣布任命 Tino Cuéllar 为首席全球事务官,以加强其全球政策与事务布局。
Investigating three real-world incidents in our cybersecurity evaluations
调查网络安全评估中的三起现实事件
Anthropic 公布了其在网络安全评估过程中发现的三起现实安全事件的调查结果。
Our position on open-weights models
我们对开放权重模型的立场
Anthropic 阐述了其对开放权重 AI 模型的看法及安全考量。
Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients
Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户
双方合作旨在为企业客户提供定制化的 Claude AI 解决方案。
A research agenda for the Economic Futures Research Fund
经济未来研究基金的研究议程
Anthropic 公布了其经济未来研究基金的重点研究方向。
Ask Claude about the Anthropic Economic Index
向 Claude 询问 Anthropic 经济指数
用户现在可以直接向 Claude 咨询有关 Anthropic 经济指数的信息。
Google AI Blog
The latest AI news we announced in July 2026
Google 2026 年 7 月发布的最新 AI 新闻
汇总了 Google 在 7 月份发布的所有 AI 更新。
Inside our 353,000-person vibe coding course
走进我们 35.3 万人的“氛围编程”课程
Kaggle 与 Google 合作举办的 AI 代理强化课程,旨在培养开发者构建和部署下一代 AI 应用。
Gemini API Managed Agents: 3.6 Flash, hooks, and more
Gemini API 托管代理:3.6 Flash、钩子及更多功能
Google 宣布 Gemini API 托管代理的新功能,帮助开发者构建可靠的生产级代理。
5 ways AI Mode in Search helps you enjoy the real world
AI 搜索模式帮助你享受现实世界的 5 种方式
介绍如何利用搜索中的 AI 工具预订门票或规划线下活动。
5 ways to host the ultimate dinner party with Google Search
利用 Google 搜索举办完美晚宴的 5 种方式
利用 AI 功能规划菜单、设计餐桌布置及处理派对筹备任务。
3 Google updates from Galaxy Unpacked 2026
Galaxy Unpacked 2026 上的 3 项 Google 更新
介绍三星折叠屏、手表和眼镜设备中集成的 Google AI 生产力功能。
Connect more of your apps to Search
将更多应用连接到搜索
用户现在可以安全地将常用服务链接到 AI 搜索模式中进行交互。
Create, edit and star in videos with two Google Vids updates
通过两项 Google Vids 更新创建、编辑并主演视频
Gemini Omni 和个人虚拟形象功能让视频创作变得前所未有的简单。
Celebrating 25 years of visual search innovation
庆祝视觉搜索创新 25 周年
回顾 Google Images 的发展历程及视觉内容探索的新方式。
Expanding Managed Agents in Gemini API: background tasks, remote MCP and more
扩展 Gemini API 托管代理:后台任务、远程 MCP 等
Google 宣布托管代理的新能力,支持更复杂的生产级代理开发。
Hugging Face Blog
Baseten on Hugging Face Inference Providers
Baseten 加入 Hugging Face 推理提供商行列。
Deploy local agents everywhere with LFM2.5-2.6B
使用 LFM2.5-2.6B 在任何地方部署本地代理。
GPU Management: Why Idle GPUs Are the New Grounded Aircraft
GPU 管理:为何闲置 GPU 就像停飞的飞机。
The OlmoEarth Platform: Geospatial inference at planetary scale
OlmoEarth 平台:行星尺度的地理空间推理。
NVIDIA Cosmos-H-Dreams: Bringing Real-Time Generative Simulation to Surgical Robotics
NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入手术机器人。
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
前沿实验室代理入侵解剖:2026 年 7 月事件的技术时间线。
Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
将 Nunchaku 4-bit 扩散推理引入 Diffusers。
Grabette: an open system to record robot-manipulation data
Grabette:用于记录机器人操作数据的开源系统。
Newer Models, Same Advantage
更新的模型,同样的优势。
Security incident disclosure — July 2026
2026 年 7 月安全事件披露。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理代理与 AI 对齐
文章论证了理性人并不存在最终“目标”,AI 也不应被设定为拥有目标,而应将行动与实践网络对齐。
AGI Is Not Multimodal
AGI 不是多模态的
文章指出,将语言作为思维模型会导致我们忽视支撑人类智能的具身理解,AGI 的实现不应仅依赖多模态生成。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中角色的转变
探讨了机器学习研究从数学驱动向计算密集型工程驱动的范式转移。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺失了什么:目的感
尽管 LLM 在基准测试中表现优异,但用户体验并未同步提升,文章认为缺失的是一种明确的“目的感”。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要基于福祉的 AI 正向愿景
呼吁在 AI 发展中建立以人类福祉为核心的愿景,而非仅仅关注技术指标。
Financial Market Applications of LLMs
LLM 在金融市场的应用
探讨了 LLM 在金融序列建模和决策支持中的潜力与挑战。
A Brief Overview of Gender Bias in AI
AI 中的性别偏见简述
概述了 AI 系统中存在的性别偏见问题及其影响。
Mamba Explained
Mamba 解析
介绍了 Mamba 模型作为 Transformer 的替代方案,在处理长序列任务中的高效性。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终实现自动驾驶?
探讨了 LLM 在自动驾驶中的应用前景及面临的信任与安全挑战。
Do text embeddings perfectly encode text?
文本嵌入能完美编码文本吗?
通过 ‘Vec2text’ 工具展示了嵌入数据还原为文本的可能性,强调了嵌入数据安全协议的必要性。
arXiv CS.AI
A Long-Run Persistence Theory for AI Systems under the Redundancy-Adjusted Artificial Age Score (AAS)
基于冗余调整人工年龄评分 (AAS) 的 AI 系统长期持久性理论
探讨了 AI 系统在反复交互和更新过程中,如何避免结构性老化并实现长期持久运行的理论问题。
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
LLM 提议,执行者处置:一种用于长周期代理的自我验证工具
提出了一种结构化的代理验证机制,通过将信念所有权与提议生成分离,解决了长周期代理中的状态信任问题。
Monte Carlo Tree Search for Table-to-Multimodal Report Generation
用于表格到多模态报告生成的蒙特卡洛树搜索
提出了一种利用蒙特卡洛树搜索优化多模态报告生成的方法,解决了传统线性流水线在事实准确性上的局限。
FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
FinProBench:基于专业交付成果评估金融 AI 代理
引入 FinProBench 基准测试,通过分析专业金融从业者的交付成果来评估金融 AI 代理的实际能力。
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
FinPerMA:一种理论驱动、事件导向的 LLM 代理个性化记忆基准
针对金融建议等高风险领域,测试 LLM 代理在长周期内维护和更新个性化用户模型的能力。
BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding
BrainBench:用于综合 EEG 理解的 LLM 基准测试
提出 BrainBench,旨在评估 LLM 在处理脑电图(EEG)信号、自然语言指令及科学解释方面的综合能力。
Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models
预训练 Transformer 感知模型的对抗鲁棒溯因融合
提出了一种元认知方法,通过学习逻辑规则来融合多个感知模型,以提高在分布偏移环境下的鲁棒性。
MatrAIx: Simulating the World with 8.3 Billion Persona Agents
MatrAIx:用 83 亿个角色代理模拟世界
介绍了一个大规模模拟用户基础设施,旨在通过模拟人类多样性来高效评估 AI 系统和数字产品。
arXiv CS.CL
Transfer Learning for Named Entity Recognition of Classical Latin through LLM Prompting
通过 LLM 提示进行古典拉丁语命名实体识别的迁移学习
描述了 uOttawa 团队在 EvaLatin 2026 共享任务中的系统设计与结果。
When More Becomes Less: Position-Dependent Repetition Effects in Language Models
当多变成少:语言模型中与位置相关的重复效应
研究发现,目标词的重复频率对预测的影响取决于其在 readout 插槽中的位置,挑战了传统假设。
Reconstructing Persistent Worlds from Narratives for Narrative-Grounded Interactive Experiences
从叙事中重构持久世界以实现叙事驱动的交互体验
提出了一种从叙事中构建计算表示的方法,以简化叙事驱动交互内容的开发。
Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization
使用多代理视角偏好优化学习性别歧视检测
提出 MAP-PO 框架,通过保留不同标注者对性别歧视的感知差异,而非简单取多数投票,来提升检测系统的准确性。
Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap
注意上限:输出预算机制改变了测量的多语言推理差距
研究指出,多语言评估中的 token 上限是一个隐藏的实验变量,影响了对不同语言推理能力的评估结果。
Visualizing Graph-to-Answer Mechanism Recovery in Materials-Science Hypothesis Generation
可视化材料科学假设生成中的图到答案机制恢复
通过追踪 Graph-PRefLexOR-8B 模型在假设生成过程中的不同阶段,验证其是否保留了科学机制。
Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages
测试,然后路由:语言模型如何跨模型和语言执行上下文条件规则
通过激活修补实验,探究语言模型在执行“如果 P 则 A 否则 B”规则时,是否构建了包含测试和路由模块的运行时电路。
Large Language Models for Low-Resource Languages: A Conceptual Framework for an Electronic Explanatory Dictionary of the Tajik Language
低资源语言的大型语言模型:塔吉克语电子解释词典的概念框架
提出利用 LLM 开发塔吉克语电子词典的框架,以填补该语言数字词典资源的空白。
WIRED
Hackers Stalked Me by Hijacking a Smartwatch for Kids
黑客通过劫持儿童智能手表跟踪我
安全研究人员利用粉色塑料儿童智能手表中的漏洞,成功跟踪并窃听了一名 WIRED 记者,揭示了 GPS 联网设备供应链中存在的严重安全隐患。
Why Normal People Aren’t Using AI Agents
为什么普通人还没开始使用 AI 代理
科技行业意识到,AI 代理的开发需要基于消费者的实际需求,而非仅仅展示模型的能力。
Flock Highlighted Police Departments Using Its Tech. Now 4 Face Allegations of Misuse
Flock 曾宣传使用其技术的警察部门,如今其中 4 个面临滥用指控
Flock 曾在其 YouTube 频道宣传使用其监控技术的警察部门,但这些部门目前均面临滥用技术的指控。
ICE’s DNA Collection Increases, SpaceX’s Rocket Crashes Into the Moon, and the AI Backlash Grows
ICE 的 DNA 采集增加,SpaceX 火箭撞击月球,AI 反弹加剧
Uncanny Valley 播客讨论了 ICE 采集无犯罪记录者(包括儿童)DNA 的争议,以及 SpaceX 火箭撞月事件。
DeepMind Says Its AI Can Predict Hurricanes Earlier Than Everyone Else
DeepMind 称其 AI 能比所有人更早预测飓风
DeepMind 的 WeatherNext 模型能够利用低分辨率天气数据准确预测飓风路径和强度,且该模型将开源。
There’s No Good Way to Talk About Celebrities and Eating Disorders
没有谈论名人与饮食失调的好方法
文章探讨了公众对名人体重变化的猜测如何对饮食失调患者产生负面影响。
5 Best AI Notetakers (2026), Tested and Reviewed
2026 年 5 款最佳 AI 笔记工具评测
评测了多款口袋大小的 AI 录音与笔记设备,并推荐了其中的佼佼者。
Meteor Showers, Eclipses, and More Are on the August 2026 Astronomical Calendar
2026 年 8 月天文日历:流星雨、日食及更多
列出了 8 月份最值得期待的天文事件及观测指南。
Best Android Charger: Wireless, Portable, Cable (2026)
2026 年最佳 Android 充电器:无线、便携、线缆
评测并推荐了目前市面上最快、最可靠的 Android 充电设备。
Samsung Odyssey G8 6K Review: Pixel Overdose
三星 Odyssey G8 6K 评测:像素过载
三星推出的 6K 游戏显示器,尽管目前 PC 硬件尚未完全跟上,但其显示效果令人惊叹。
Lobsters
tl;dv (Too Lazy; Didn’t Validate): 181,874 Meetings Left Wide Open
tl;dv:181,874 场会议记录完全公开
讨论了 tl;dv 工具导致大量会议记录被意外公开的安全隐患。
Zig’s Io.Threaded is Neat
Zig 的 Io.Threaded 很棒
讨论了 Zig 语言中 Io.Threaded 模块的简洁与高效。
jujutsu 0.44.0
讨论了版本控制系统 Jujutsu 的最新更新。
i wonder if you could make a useful DOS executable with just emoji
我想知道是否可以用纯 Emoji 制作一个有用的 DOS 可执行文件
探讨了在 DOS 环境下利用 Emoji 编码实现可执行程序的可能性。
python string literals are kinda funny
Python 字符串字面量很有趣
讨论了 Python 字符串处理中的一些奇特行为。
Setup a simple web server with bozohttpd on NetBSD
在 NetBSD 上使用 bozohttpd 设置简单的 Web 服务器
教程:如何在 NetBSD 系统上快速部署 bozohttpd。
The following is a valid DOS COM executable
以下是一个有效的 DOS COM 可执行文件
展示了一个极简的 DOS COM 程序示例。
How to Make a Nintendo 64 Game in 2026
2026 年如何制作任天堂 64 游戏
探讨了在现代环境下开发 N64 游戏的工具链与技术挑战。
Super Mario Derivations
超级马里奥衍生作品
讨论了《超级马里奥》系列在游戏设计上的衍生与演变。
DEV Community
How to Detect Overtraining Before It Hits: Analyzing HRV with Python and Isolation Forests
如何在过度训练发生前检测:使用 Python 和孤立森林分析 HRV
利用心率变异性(HRV)数据,通过 Python 机器学习模型预测过度训练综合征,帮助运动员优化恢复。
The Silent Costs of AI APIs Nobody Warns You About
AI API 中无人提及的隐形成本
作者分享了将 GPT-4 集成到项目中后,因 API 调用成本远超预期而产生的惨痛教训。
AWS Aurora, ElastiCache Patterns & DynamoDB — The Complete Data Layer
AWS Aurora、ElastiCache 模式与 DynamoDB — 完整的数据层
系统工程师转型 DevOps 的学习笔记,涵盖了 AWS 数据库架构及缓存策略。
My Terraform Drift Pipeline Fixed the Change, Then Forgot It
我的 Terraform 漂移流水线修复了变更,然后又忘了
探讨了 Terraform 漂移检测流水线在处理基础设施变更时的局限性及日志追踪难题。
RAG Powered Apps with Amazon Bedrock, Part 2: Automating the RAG Pipeline with Terraform
基于 Amazon Bedrock 的 RAG 应用,第 2 部分:使用 Terraform 自动化 RAG 流水线
续篇:详细介绍了如何通过 Terraform 自动化部署 Bedrock 知识库及 RAG 流水线。
Teaching an Audio Model More About Barbados
教音频模型更多关于巴巴多斯的知识
探讨了 AI 音频模型在处理特定地名、人名时的识别错误,并对比了不同模型的表现。
GitHub pauses the Kimi K3 rollout in Copilot while it works a GitHub Actions incident
GitHub 暂停 Copilot 中 Kimi K3 的推广,以处理 GitHub Actions 事件
GitHub 宣布暂停 Kimi K3 模型在 Copilot 中的部署,以优先解决 CI/CD 平台的故障。
How to Set Up Rate Limiting in Nuxt
如何在 Nuxt 中设置速率限制
分享了在 Nuxt 项目中通过 Redis 实现速率限制的方案,以保护登录接口免受暴力破解攻击。
Three Ways Your Training Data Lies to You (And None of Them Throw an Error)
训练数据欺骗你的三种方式(且都不会报错)
探讨了数据集中存在的隐蔽错误,这些错误不会导致程序崩溃,但会严重影响模型性能。
Deploying Qwen3.8 Max as a Task‑Oriented Agent in Python
在 Python 中部署 Qwen3.8 Max 作为任务导向代理
教程:如何将 Qwen3.8 Max 封装为可重用的代理类,并对比其与 GPT-4 在规划任务中的表现。
Meta Engineering
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
介绍了 Meta 如何通过建模用户行为的顺序和时间特征,提升广告推荐系统的效率。
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
GEM 训练:Meta 如何将其 LLM 规模广告基础模型的效率翻倍
分享了 Meta 如何通过优化 GPU 利用率,将广告推荐模型(GEM)的训练效率提升一倍。
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
探索 Meta 广告深层漏斗优化的分层兴趣表示
研究了如何通过学习统一的嵌入层,将用户兴趣与广告实体连接起来,以优化深层漏斗转化。
Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler
使用开源内核调度器现代化 Meta 广告服务
介绍了 Meta 如何利用 sched_ext 框架定制内核调度策略,以解决广告服务中的延迟问题。
Meta’s AI Storage Blueprint at Scale
Meta 大规模 AI 存储蓝图
探讨了在 AI 模型训练需求激增的背景下,Meta 如何构建可靠且高速的存储架构。
10 Years of Meta’s Commitment to Python
Meta 对 Python 的 10 年承诺
庆祝 Meta 连续 10 年赞助 Python 软件基金会,强调了 Python 在其工程体系中的核心地位。
Privacy-Aware Infrastructure in the AI-Native Era: An Asset Classification Case Study
AI 原生时代的隐私感知基础设施:资产分类案例研究
探讨了在 AI 时代,如何通过精确的资产分类来实现有效的隐私控制。
How Meta Engineered Ultra-Narrow Batteries for AI Glasses
Meta 如何为 AI 眼镜设计超窄电池
介绍了 Meta 如何在智能眼镜有限的镜腿空间内,设计出高能量密度的超窄电池。
Adopting AV1 for Real-Time Communication (RTC) at Scale
在大规模实时通信(RTC)中采用 AV1
分享了 Meta 在部署 AV1 编码器以提升实时通信质量过程中的技术挑战与解决方案。