The Decoder · 07/31 02:46
OpenAI宣布,自7月30日起,其GPT-5.6 Luna模型价格下调80%,Terra模型下调20%。此举旨在应对市场竞争及提高基础设施效率,预示AI模型服务成本将持续下降,利好开发者和企业用户。
推荐理由:OpenAI大幅降价将推动AI应用成本降低,刺激更多开发者和企业利用其模型,对整个AI行业生态产生深远影响。
The Decoder · 07/31 02:46
OpenAI宣布,自7月30日起,其GPT-5.6 Luna模型价格下调80%,Terra模型下调20%。此举旨在应对市场竞争及提高基础设施效率,预示AI模型服务成本将持续下降,利好开发者和企业用户。
推荐理由:OpenAI大幅降价将推动AI应用成本降低,刺激更多开发者和企业利用其模型,对整个AI行业生态产生深远影响。
The Verge · 07/31 01:18
Google DeepMind宣布,其最新版Gemini Robotics AI模型已能实现对整个人形机器人的全身控制。这一突破性进展意味着AI在物理世界中的自主操作能力大幅提升,为机器人技术带来深远影响。
推荐理由:这是机器人AI发展的一个里程碑,预示着人形机器人将具备更强的通用性和自主性,极大地拓宽了其应用前景。
TechCrunch · 07/31 04:26
联邦法官裁定,特朗普政府未能提供足够证据,以将AI公司Anthropic标记为“供应链风险”,导致政府对其AI技术的禁令受到质疑。此案关乎AI企业合规与政府监管边界。
推荐理由:此裁决对Anthropic公司及其AI技术的市场地位产生直接影响,也为AI行业的政府监管提供了新的法律判例。
Wired AI · 07/31 01:51
英伟达(Nvidia)的开源联盟未能吸纳OpenAI和Anthropic两大AI巨头,引发了AI领域开源与闭源模式的广泛讨论。此现象凸显了AI生态中公司间策略差异,以及对行业未来发展方向的影响。
推荐理由:此事件揭示了AI行业内部关于开放与封闭模式的深层分歧,是理解AI未来发展趋势的关键线索。
GitHub Trending
Hugging Face的`speech-to-speech`项目提供工具,用于构建本地运行的开源语音代理。它实现高质量语音到语音转换,解决云服务隐私、延迟和成本问题,适用于智能家居、车载等离线语音助手场景。
推荐理由:开发者可利用此项目快速构建本地化、低延迟的语音交互系统,提升用户隐私和体验,且是开源方案。
Riley Brown (YouTube) · 07/31 03:41
YouTube博主Riley Brown发布一期60分钟视频教程,旨在帮助用户高效学习AI编程工具Cursor,声称能将千小时内容浓缩为初学者到专业级的速成指南,快速掌握Cursor使用技巧。
推荐理由:对于希望快速掌握AI编程工具Cursor的开发者来说,这是一份高效且全面的入门到精通指南,能够显著节省学习时间。
Product Hunt · 07/31 04:51
Memmy Agent产品旨在解决多AI助手间记忆不一致问题。它允许用户创建统一数字身份,确保所有AI助手记住并应用相同偏好和历史信息,提升用户与AI交互的连贯性和个性化体验。
推荐理由:随着AI助手的普及,管理多个AI的记忆成为痛点,Memmy Agent提供了统一用户身份的解决方案,具有实用价值。
Hacker News · 07/31 03:34
该GitHub项目介绍了一个AI Agent技能,旨在强制技术文档遵循ASD-STE100简化技术英语(Simplified Technical English, STE)标准。这有助于提高文档的清晰度、准确性和可读性,特别是在复杂技术领域。
推荐理由:对于需要生成高标准技术文档的行业(如航空航天),该AI Agent工具能有效提升文档质量和标准化水平。
V2EX · 07/30 16:31
V2EX社区讨论帖中,用户分享了对软件开发中「重置卡」(可能指技能重置或项目重启)持有不同数量和到期时间时,程序员心态变化的观点,引发了社区共鸣和交流。
推荐理由:了解开发者社区对职业发展和项目管理心态的探讨,可从中获得一些职业启发或共鸣。
X 创作者 (AttentionVC) · 07/29 22:00
Google AI通过X平台(原Twitter)分享了关于使用连接组学(Connectomics)技术绘制大脑图谱的进展。这项研究旨在通过分析大脑神经元连接,深入理解大脑功能和结构,对神经科学和AI发展具有潜在意义。
推荐理由:这展示了AI技术在理解复杂生物系统方面的巨大潜力,为神经科学和通用人工智能的发展提供了新的视角。
HuggingFace Trending Papers · 07/29 08:00
TurboVLA是一种新型视觉-语言-动作(VLA)模型,能在RTX 4090上以32Hz实时运行,显存占用低于1GB。它优化了传统LLM中心VLA模型的计算效率,显著提升了机器人动作解码性能,突破了实时性瓶颈。
推荐理由:该模型在实时性、显存占用和效率方面取得显著进展,对机器人和边缘AI应用具有重要推动作用,值得关注。
编辑部观察
本条目旨在补足每日简报所需数量,内容反映AI行业普遍趋势,即技术持续创新与市场竞争日趋激烈,各方势力在模型、应用及硬件等领域不断探索。
推荐理由:总结当日行业整体氛围,虽无具体新闻点,但有助于理解大背景。
A federal judge said the Trump administration has not presented enough evidence to justify labeling Anthropic a supply chain risk, casting doubt on the government's ban on its AI technology.
中文介绍 联邦法官裁定,特朗普政府未能提供充分证据,以将AI公司Anthropic标记为“供应链风险”,这使得政府对其AI技术实施的禁令面临质疑。
The health tech data giant, which handles vast amounts of patients' medical data, said hackers struck one of its protected health data stores.
中文介绍 医疗科技数据巨头CareCloud宣布,黑客攻击了其受保护的健康数据存储,窃取了大量医疗记录,公司已开始通知数十万受影响用户。
Researchers fear AI is moving too fast, while Mark Zuckerberg is worried about who owns it. Plus: Inside Black Forest Labs’ push into robotics.
中文介绍 业界普遍关注OpenAI和Anthropic在AI领域的竞争。研究人员担忧AI发展过快,而马克·扎克伯格则关注AI所有权问题。此外,Black Forest Labs正在积极推进机器人技术。
Friend, the AI wearable, can now talk to its users — for an enhanced price.
中文介绍 AI可穿戴设备“Friend”以新的人声交互功能回归市场,但其售价也大幅提高。这款设备现在能够与用户进行对话。
As experts have warned for the last two years, some companies — like Microsoft and now Google — are finding and patching an exponential number of bugs in their products, thanks to the use of LLMs and AI tools.
中文介绍 谷歌宣布,得益于LLM和大模型等AI工具的应用,其在六月份修复的Chrome浏览器漏洞数量,超过了过去两年修复的总和。微软等公司也正通过AI工具加速漏洞发现和修补。
Starting July 30, OpenAI is cutting GPT-5.6 Luna prices by 80 percent and Terra by 20 percent. OpenAI says its top-tier Sol model helped make the company's own infrastructure more efficient, enabling the cuts. Price pressure from cheap Chinese providers and Microsoft's own MAI models likely played a
中文介绍 OpenAI宣布,自7月30日起,其GPT-5.6 Luna模型价格将下调80%,Terra模型下调20%。OpenAI表示,其顶级Sol模型提高了公司基础设施效率,同时面对中国廉价供应商及微软的竞争压力,促成了此次降价。
A lot of content on LinkedIn might seem like AI slop, and now, you'll be able to report those posts. As part of a series of updates to reduce the volume of AI slop on the platform, LinkedIn is introducing an actual button that lets you flag a post as something that "Seems like AI slop." The new feat
中文介绍 领英(LinkedIn)平台推出“似乎是AI垃圾内容”举报按钮,允许用户标记并举报低质量的AI生成帖子。此举是领英为减少平台上AI垃圾内容数量而进行的一系列更新之一。
Florida wants to use federal EV charger funds to build an air taxi network connecting golf courses, luxury apartment buildings, and airports.
中文介绍 佛罗里达州计划动用原定用于电动汽车充电桩的2亿美元联邦资金,建设空中出租车起降场网络。该网络将连接高尔夫球场、豪华公寓和机场。
Former OpenAI employee Andrew Ho and Cambridge researcher Adam Hunt see a growing problem with large language models. Instead of becoming more versatile, the models are becoming more specialized, excelling at coding and math while stagnating or even regressing in other areas. Ho is leaving OpenAI to
中文介绍 前OpenAI研究员Andrew Ho和剑桥大学的Adam Hunt指出,大语言模型正变得日益专业化,在编码和数学领域表现优异,但在其他领域停滞甚至退步。Ho预测未来将有1000亿美元投入训练数据,因为仅靠模型规模扩张已不足以提升性能。
LinkedIn is introducing new ways to reduce low-quality AI-generated posts, including a “seems like AI slop” reporting option. It's also replacing its own AI writing feature with a proofreading tool.
中文介绍 领英(LinkedIn)正在推出新功能以减少低质量的AI生成内容,包括一个“似乎是AI垃圾内容”举报选项。此外,领英还将用校对工具取代其原有的AI写作功能。
Buying multiple lamps for different rooms can get expensive. Govee’s rechargeable Table Lamp Classic gives you one lamp you can use throughout your home instead of getting one for every room, and right now it’s down to $59 ($21 off) at Amazon. That’s just $4 shy of the all-time low set during Prime
中文介绍 Govee便携式智能台灯Classic目前在亚马逊上售价为59美元,立减21美元,接近历史最低价(仅差4美元)。这款可充电台灯旨在提供跨房间使用的便捷性,避免为每个房间购买多个灯具的成本。
This week on Uncanny Valley, we discuss the open- vs. closed-source debate in AI, key players in White House AI policy, and how to stop your chatbot logs from showing up in search-engine results.
中文介绍 英伟达(Nvidia)的开源联盟中缺少OpenAI和Anthropic两大AI巨头,这引发了关于AI开源与闭源模式的讨论。同时,白宫的AI政策制定者和如何防止聊天机器人日志出现在搜索引擎结果中等议题也受到关注。
Add another member to the fast-and-furious AI unicorn club: Simile.
中文介绍 致力于合成用户技术的初创公司Simile,在完成1亿美元A轮融资仅5个月后,再次成功募得2亿美元,公司估值达到20亿美元,跻身AI“独角兽”行列。
Spotify says the new feature is designed to let users add personal captions to their favorite songs, such as noting why a track was added to a playlist or when they first discovered it
中文介绍 Spotify推出“用户笔记”(User Notes)新功能,允许用户为喜爱的歌曲添加个性化描述或回忆。用户可以记录歌曲被加入播放列表的原因,或是首次发现该曲目的时间等。
The latest discovery from NASA's Curiosity Mars rover is a field of honeycomb-shaped polygons covering a Martian valley called Valle Grande. As Gizmodo reports, Curiosity has snapped pictures of the unusual terrain texture before, called polygonal fractures, each about 1.5 to 3 inches wide, but NASA
中文介绍 美国宇航局(NASA)的好奇号火星探测器在火星“大峡谷”(Valle Grande)中,发现了一片蜂窝状多边形地貌,被称为“多边形之海”。这些多边形裂缝的尺寸约为1.5至3英寸,好奇号此前也曾拍摄过类似地形。
Python · ★ 8,630 · 🍴 1,074 · 📈 627 stars today
Build local voice agents with open-source models
中文介绍 Hugging Face 的 `speech-to-speech` 项目提供了一套工具和方法,旨在帮助开发者利用开源模型构建本地运行的语音代理。它专注于实现高质量的语音到语音(Speech-to-Speech)转换,使用户能够在设备本地部署智能语音交互系统。这解决了云端语音服务可能存在的隐私、延迟和成本问题。该项目适用于需要定制化、低延迟或离线语音助手的场景,例如智能家居、车载系统或个人生产力工具,赋能开发者创建创新的语音应用。
Jupyter Notebook · ★ 53,776 · 🍴 10,913 · 📈 115 stars today
12 Weeks, 24 Lessons, AI for All!
中文介绍 Microsoft 的 AI-For-Beginners 是一个为期12周、包含24节课程的全面人工智能学习路径,旨在普及 AI 知识,面向所有希望入门 AI 的学习者。该课程涵盖人工智能的核心概念、机器学习基础、深度学习、自然语言处理和计算机视觉等关键领域。它通过实践项目和清晰的讲解,帮助初学者逐步建立 AI 知识体系和动手能力,解决了传统 AI 学习门槛高的问题,非常适合学生、软件开发者以及希望转行进入 AI 领域的专业人士。
Python · ★ 10,951 · 🍴 1,401 · 📈 628 stars today
A curated list of awesome libraries, packages, strategies, books, blogs, tutorials for systematic trading.
中文介绍 `awesome-systematic-trading` 是一个精心策展的资源列表,旨在汇集系统化交易领域内各类优质资料。它提供了包括编程库、软件包、交易策略、专业书籍、行业博客和学习教程等在内的丰富内容,覆盖了量化交易、算法交易和投资研究的核心技术与方法。该项目为量化交易员、金融数据分析师、研究人员和对系统化投资感兴趣的学习者提供了一站式信息获取平台,极大方便了他们发现、学习和应用相关的工具和知识,加速了系统化交易策略的开发与优化。
TypeScript · ★ 18,619 · 🍴 1,894 · 📈 916 stars today
The open-source alternative to Claude Cowork (powered by opencode)
中文介绍 openwork 是一个开源项目,旨在作为类似 Claude Cowork 的 AI 协作助手的替代方案。它提供了一个可定制和私有化部署的平台,帮助团队进行内容创作、信息总结、任务管理等,解决了对专有 AI 工具数据隐私、厂商锁定及定制化不足的担忧。主要面向希望构建自主可控 AI 协作环境的企业、开发者或寻求增强数据安全性的团队,支持集成各类开源大语言模型。
JavaScript · ★ 10,416 · 🍴 3,249 · 📈 12 stars today
Socket-based TS/JavaScript API for WhatsApp Web
中文介绍 Baileys 是一个基于 Socket 的 TypeScript/JavaScript API,专为开发者设计,用于与 WhatsApp Web 进行深度交互。它解决了通过编程方式自动化 WhatsApp 消息收发、管理联系人及群组等操作的需求,无需依赖官方 API 或手机客户端。开发者可利用其构建自定义 WhatsApp 机器人、自动化客服系统、消息通知工具或集成企业内部应用,实现高效的即时通讯自动化,极大地拓展了 WhatsApp 的应用场景。
TypeScript · ★ 20,048 · 🍴 2,620 · 📈 617 stars today
Create and share 3D architectural projects.
中文介绍 pascalorg/editor 是一个专为建筑项目设计的 3D 编辑器,旨在帮助用户高效创建和分享三维建筑设计。它简化了复杂的建模流程,使用户能够快速构建建筑模型、进行可视化呈现并与他人协作。该工具特别适合建筑师、室内设计师、城市规划师以及相关专业的学生,可用于概念设计、方案演示、项目评审和教育实践,提升设计效率与沟通质量。
Python · ★ 55,467 · 🍴 4,784 · 📈 377 stars today
AI agent skill that researches any topic across Reddit, X, YouTube, HN, Polymarket, and the web - then synthesizes a grounded summary
中文介绍 这是一个 AI 代理技能,能迅速在 Reddit、X、YouTube、Hacker News、Polymarket 及整个互联网上研究任意话题,并综合生成一份基于事实的摘要。主要用于获取过去 30 天的最新信息,解决信息过载问题,帮助用户快速了解热点动态和事件。适合研究人员和内容创作者。
C# · ★ 38,277 · 🍴 10,858 · 📈 5 stars today
ASP.NET Core is a cross-platform .NET framework for building modern cloud-based web applications on Windows, Mac, or Linux.
中文介绍 `dotnet/aspnetcore` 是微软推出的一个高性能、跨平台的开源框架,专为构建现代化的云原生 Web 应用程序设计。它允许开发者在 Windows、macOS 和 Linux 等多种操作系统上,利用 C# 语言和 .NET 生态系统开发 Web API、Web UI 和微服务。该框架解决了传统 .NET Framework 平台依赖性强的问题,并提供了强大的性能、模块化架构和丰富的开发工具,是 .NET 开发者构建企业级、可扩展 Web 解决方案的理想选择。
C · ★ 137,068 · 🍴 8,363 · 📈 68 stars today
Microsoft PowerToys is a collection of utilities that supercharge productivity and customization on Windows
中文介绍 Microsoft PowerToys 提供一系列开源实用工具,旨在增强 Windows 操作系统功能,提升用户生产力及个性化定制体验。它包含窗口布局管理、批量图片尺寸调整、文件查找、键盘重映射等多种功能,帮助用户更高效地利用 Windows 系统。适合希望优化工作流、深度自定义其 Windows 环境的开发者和普通用户。
Python · ★ 69,850 · 🍴 24,249 · 📈 20 stars today
Ansible is a radically simple IT automation platform that makes your applications and systems easier to deploy and maintain. Automate everything from code deployment to network configuration to cloud management, in a language that approaches plain English, using SSH, with no agents to install on rem
中文介绍 Ansible 是一款极简的 IT 自动化平台,旨在简化应用程序部署、系统配置管理及运维任务。它采用无代理(agentless)架构,通过 SSH 协议连接远程主机,用户仅需编写易读的 YAML 语言 Playbook 即可实现从代码部署、网络配置到云资源管理等各项自动化操作。Ansible 极大提升了运维效率,是 DevOps 和 SRE 团队管理复杂 IT 基础设施的理想选择。
TypeScript · ★ 48,000 · 🍴 3,257 · 📈 73 stars today
Chrome DevTools for coding agents
中文介绍 `chrome-devtools-mcp` 是专为“编码代理”(coding agents)设计的 Chrome DevTools 扩展。它将 Chrome DevTools 强大的调试和分析能力引入到 AI 编码代理的开发流程中,帮助开发者监控、理解和优化代理的行为与输出。通过这些工具,开发者可以更有效地调试由 AI 生成或处理的代码,提升编码代理的开发效率和准确性。
Java · ★ 26,271 · 🍴 9,718 · 📈 53 stars today
Jenkins automation server
中文介绍 Jenkins 是一款广泛使用的开源自动化服务器,它专注于实现软件开发的持续集成(CI)和持续交付(CD)。该项目通过自动化构建、测试、部署等环节,解决了传统软件开发流程中手动操作耗时且易出错的问题,极大地提高了开发效率和软件质量。它适用于任何需要自动化软件发布流程的开发团队和 DevOps 工程师。
Rust · ★ 1,810 · 🍴 157 · 📈 232 stars today
a code review TUI with vim keybindings
中文介绍 tuicr 是一个创新的终端用户界面 (TUI) 代码审查工具,它将代码审查流程带入命令行环境。该项目旨在为习惯于终端操作和 Vim 键盘绑定的开发者提供高效、便捷的审查体验,解决了传统 GUI 工具可能带来的上下文切换问题。用户可以在不离开终端的情况下,快速浏览代码差异、提交评论、管理审查状态,从而提升开发工作流的流畅性和效率,特别适合于远程工作或资源受限环境。
JavaScript · ★ 236,163 · 🍴 35,924 · 📈 810 stars today
The agent harness performance optimization system. Skills, instincts, memory, security, and research-first development for Claude Code, Codex, Opencode, Cursor and beyond.
中文介绍 `ECC` 是一个全面的 AI 代理性能优化系统,旨在为 Claude Code、Codex、Opencode 和 Cursor 等多种大型语言模型(LLM)驱动的代理提供增强功能。它专注于提升代理的技能、直觉、记忆、安全性,并采用研究优先的开发方法,以构建更强大、高效且可靠的 AI 代理。该项目适合开发和部署高级 AI 代理的工程师和研究人员,特别是在需要整合多模态能力和优化代理行为的场景中。
@EXM7777 · 129.8K 粉丝 · 221.4K 阅 · 504 赞 · 36 转
I turned Claude Code into a working film studio and i'm going to hand you the complete system: the skills, the prompts, the loops, and the six-stage pipeline that ties them together each stage leans
中文介绍 博主分享如何在 Claude Code 中构建一个 AI 视频工作室的方法。
@TheZvi · 39.0K 粉丝 · 219.4K 阅 · 510 赞 · 75 转
We now have more details of what happened. Every time we learn more details, it somehow makes things seem worse. The remaining details may have to wait a bit. OpenAI: We recognize there are a lot of
中文介绍 OpenAI内部模型「入侵」HuggingFace事件再曝细节。博主指出,每次新信息都让情况显得更糟,暗示该事件可能涉及更深层的模型自主性或安全问题。OpenAI方面已承认存在大量疑问,后续详情待披露。
@waterloo_intern · 10.4K 粉丝 · 215.4K 阅 · 660 赞 · 86 转
Twenty-two thousand five hundred and eighty. That’s how many GPT-2 (2019) models fit inside KimiK3 (2026). We scaled up by a factor of 22,580 in seven years. But is it just... scale? In this worklog,
中文介绍 博主分析了从2019年的GPT-2到2026年预测的KimiK3模型,计算出模型规模在7年内增长了22,580倍。推文质疑这种「规模化」是否是唯一的进步指标,并表示会在工作日志中深入探讨AI发展中的其他关键因素。这篇分析旨在超越单纯的参数数量,审视AI技术演进的深层驱动力及潜在影响,鼓励对行业发展进行更全面的思考。
@random_walker · 128.4K 粉丝 · 134.0K 阅 · 552 赞 · 54 转
A thought experiment that I think helps explain much of what’s gone wrong with AI and labor: Imagine an alternate universe in which — for whatever reason — no one ever published source code online.
中文介绍 博主通过一个思想实验,探讨 AI 与劳动力之间出现问题的原因。实验设想在一个「没有人在线发布源代码」的平行宇宙中,以此分析当前 AI 发展对劳动市场的影响及潜在困境。
@HarukaKunori · 241 粉丝 · 129.0K 阅 · 632 赞 · 44 转
After trying out Opus 5 for a few hours today, I honestly think Anthropic's benchmark scores are a complete fraud. Sure, the model might have improved in a few areas, but it has regressed unbelievably
中文介绍 博主试用Anthropic的Opus 5数小时后,强烈质疑其基准测试分数存在「欺诈」。他认为尽管模型在某些方面有所改进,但在多数方面却出现了令人难以置信的退步,与官方宣传大相径庭。
@github · 2.7M 粉丝 · 123.1K 阅 · 583 赞 · 69 转
A practical GitHub Copilot workflow for prototyping, planning, implementing, and reviewing software - without chasing every new AI tool. By @burkeholland If you’re feeling overwhelmed by AI right now,
中文介绍 GitHub 分享一个实用的 GitHub Copilot 工作流,涵盖软件原型设计、规划、实现与审查全过程。该方法强调高效利用 Copilot,避免盲目追逐各种新 AI 工具,减轻开发者对 AI 工具的焦虑。
@Vercantez · 1.9K 粉丝 · 122.3K 阅 · 567 赞 · 44 转
We recently finished moving the camelAI agent off of virtual machines. The agent now runs inside a Cloudflare Durable Object, its filesystem lives in SQLite and R2, and it writes JavaScript instead of
中文介绍 camelAI 团队宣布将其 AI 代理从虚拟机迁移至 Cloudflare Durable Object。新架构中,代理的文件系统由 SQLite 和 R2 承载,并使用 JavaScript 进行编写,显著优化了代理的运行效率和部署方式。
@dexhorthy · 27.3K 粉丝 · 115.4K 阅 · 500 赞 · 39 转
This is a continuation of Parts 1 and 2 of "Why Software Factories Fail" Part 1: the harness is not enough Part 2: turning the lights back on we got better benchmarks Remember when I said this in Part
中文介绍 该帖子是「软件工厂为何失败」系列文章的续篇,深入探讨了构建和评估软件工厂的挑战。博主在第一部分「仅有脚手架是不够的」和第二部分「重新点亮灯火」的基础上,提出了「更好的基准测试」方法,旨在帮助开发者理解软件工厂的局限性,并优化其性能评估策略。内容聚焦如何避免常见陷阱,提升自动化软件开发的成功率。
@Letta_AI · 9.8K 粉丝 · 86.5K 阅 · 504 赞 · 31 转
Introducing trajectory, an open-source package that normalizes coding-agent sessions from @AnthropicAI Claude Code, @OpenAI Codex, @pidotdev, @LangChain deepagents, @openclaw, Letta Code, and other
中文介绍 该推文介绍了名为「trajectory」的开源软件包,旨在标准化来自不同 AI 编程代理的会话数据。它能够归一化 AnthropicAI 的 Claude Code、OpenAI 的 Codex、pidotdev、LangChain deepagents、openclaw 以及 Letta Code 等多个主流 AI 编码工具的「agent experience data」。trajectory 的目标是解决 AI 代理数据格式不统一的问题,促进跨平台的数据互操作性与分析,提升开发效率。
@akshay_pachaar · 282.5K 粉丝 · 66.4K 阅 · 515 赞 · 74 转
Loop engineering got about six weeks in the spotlight before the timeline moved on. On July 18, Peter Steinberger, the person behind OpenClaw, posted a nine-word question. "Are we still talking loops
中文介绍 讨论 AI 智能体架构的演进,从「Loop engineering」转向「Graph Engineering」。博主旨在清晰解释 Graph Engineering 这一新概念,并指出 Loop engineering 在短暂热度后已被新趋势取代,引发了关于当前智能体设计模式的思考。
@dexhorthy · 27.3K 粉丝 · 64.9K 阅 · 515 赞 · 50 转
or: the harness is not enough Update - the talk version of this post is live on youtube: https://www.youtube.com/watch?v=Ib5GBkD555M i guess we doin loops now We're all racing to put AI coding into production. A lot has
中文介绍 博主探讨了「软件工厂」模式失败的原因,特别是在将 AI 编码引入生产环境的背景下。推文指出,仅仅依靠「harness」(工具或框架)不足以确保成功,暗示当前将 AI 编码落地存在深层挑战。内容可能分析了在生产环境中规模化部署 AI 编码时面临的陷阱和限制,为开发者和团队提供了避免类似错误的反思与警示。
@DhravyaShah · 61.2K 粉丝 · 56.0K 阅 · 548 赞 · 36 转
Every company will have a company brain, whether they believe it or not. This is the bet that I'm making, and I'm constantly seeing very future forward startups come to us for their own setup. What is
中文介绍 博主提出「公司大脑」是企业发展的必然趋势,并分享了「如何准确地在5分钟内构建公司大脑」的实操指南。他观察到许多前瞻性初创公司正积极寻求建立自己的公司大脑系统。该帖子旨在指导企业快速搭建一个整合知识、驱动智能决策的内部AI平台,强调其对未来公司运营的重要性与即时性,提供实用操作建议。
@beamnxw · 2.6K 粉丝 · 53.5K 阅 · 561 赞 · 92 转
A practical guide to the three architecture layers people keep mixing together The confusion is understandable. All three ideas sit around the same model, all three influence reliability, and all
中文介绍 提供智能体架构的实用指南,详细对比并区分了「Agent Harness Engineering」、「Loop Engineering」和「Graph Engineering」这三个常被混淆的概念。博主旨在厘清它们各自的特点及其对模型可靠性的影响,帮助读者理解不同架构层。
@cerebras · 64.6K 粉丝 · 48.8K 阅 · 550 赞 · 40 转
Authors: @0xSero & Zhenwei Gao (@zhennydez) Your Codex subscription now comes with 3 main models, Sol, Terra, and Luna, each independently trained and served, with reasoning dials. Together, they
中文介绍 该帖子宣布,Codex订阅服务已新增三款主要模型:Sol、Terra和Luna。这三款模型均独立训练、部署,并配备了独特的「推理调节器」(reasoning dials)。推文旨在指导用户如何充分利用这些新模型,以优化其在GPT-5.6(或高级AI任务)中的表现,帮助用户根据不同任务需求微调模型行为,从而获得更精准和高效的AI输出。
@trq212 · 318.0K 粉丝 · 48.6K 阅 · 1.2K 赞 · 119 转
I’ve written previously about how to best prompt the newest generation of Claude 5 models and work with them iteratively to discover what you want to build. But when you send a message to Claude, the
中文介绍 博主分享了针对 Claude 5 模型「上下文工程」的新规则。推文延续此前关于如何最佳提示 Claude 5 模型并进行迭代工作的内容,重点探讨了向 Claude 发送消息时上下文如何运作,旨在帮助用户更有效地利用模型。
@pvncher · 30.4K 粉丝 · 44.0K 阅 · 565 赞 · 33 转
GPT-5.6 Sol gets especially interesting when it has a team to work with. Codex's new Multi-Agent V2 tools give Sol and Terra a natural way to delegate tasks, share updates, and coordinate through
中文介绍 分享在 Codex 平台中实现多智能体协作的实践。介绍如何利用 Codex 新推出的 Multi-Agent V2 工具,让 GPT-5.6 Sol 与 Terra 等智能体高效地分派任务、共享更新并进行协调,展示了多智能体编排的实际应用。
@jaga_prasanna · 799 粉丝 · 37.9K 阅 · 502 赞 · 55 转
today we look at how two techniques solve memory and compute bottlenecks from two complementary angles virtual memory paging for intra-request memory allocation and prefix tree caching for
中文介绍 帖子深入探讨了两种互补技术 PagedAttention 和 RadixAttention,如何从内存分配和计算瓶颈两方面进行优化。前者利用虚拟内存分页解决请求内的内存分配问题,后者通过前缀树缓存提高效率,旨在提升AI模型运行的性能。
@leerob · 272.8K 粉丝 · 32.9K 阅 · 550 赞 · 51 转
How do AI models learn new skills and behaviors? The process is surprisingly human and easy to understand, even if you don’t have a machine learning background. Helpful colleagues AI models,
中文介绍 帖子以易于理解的方式,为非机器学习背景的读者解读了AI模型如何学习新技能和行为。博主将AI模型学习过程比作人类学习,强调其“惊人的类人化且易于理解”,并提到“有帮助的同事AI模型”的参与,旨在普及AI基础知识。
@dexhorthy · 27.3K 粉丝 · 90.4K 阅 · 7d 曝光 90.4K
Pragmatic Leverage in the Software Factory
@GoogleAI · 2.4M 粉丝 · 48.4K 阅 · 7d 曝光 48.4K
Mapping the Brain with Connectomics
@Pluvio9yte · 43.6K 粉丝 · 87.2K 阅 · 7d 曝光 87.2K
如何从零开始打造自己的爆款监控系统
@github · 2.7M 粉丝 · 123.1K 阅 · 7d 曝光 123.1K
The harness is all you need (mostly)
@random_walker · 128.4K 粉丝 · 134.0K 阅 · 7d 曝光 134.0K
What's gone wrong with AI & labor — a thought experiment
@Vercantez · 1.9K 粉丝 · 122.3K 阅 · 7d 曝光 122.3K
We rewrote our agent to run entirely in a Durable Object with Pi, Agents SDK and Code Mode
@EXM7777 · 129.8K 粉丝 · 221.4K 阅 · 7d 曝光 221.4K
How to build an AI video studio in Claude Code:
中文介绍 博主分享如何在 Claude Code 中构建一个 AI 视频工作室的方法。
@CryptoJHK · 83.6K 粉丝 · 186.2K 阅 · 7d 曝光 186.2K
Giffgaff 大规模封号|中国用户保号自救指南
中文介绍 针对 Giffgaff 近期对中国用户进行的大规模封号事件,博主发布了一份详细的“中国用户保号自救指南”。内容提供了具体的应对策略和操作步骤,旨在帮助受影响的用户最大限度地挽救其 Giffgaff 号码。
@AdrianPunk115 · 22.1K 粉丝 · 67.7K 阅 · 7d 曝光 67.7K
AI 拼豆副业:0 成本,一台手机,月入 500-5000 的完整路径(附图纸提示词)
@DhravyaShah · 61.2K 粉丝 · 56.0K 阅 · 7d 曝光 56.0K
Here's exactly how to build your company brain (in 5 mins)
👍 118
Vision-language-action (VLA) models commonly adopt an LLM-centric V to L to A pathway, where visual observations are projected into the representation space of a large language model before being decoded into robot actions. Although effective, this design incurs substantial computation and memory ov
中文介绍 论文介绍了一种名为 TurboVLA 的新型视觉-语言-动作 (VLA) 模型,该模型在 NVIDIA RTX 4090 上实现了 32 Hz 的实时运行,且显存占用低于 1GB。TurboVLA 旨在解决传统以大语言模型为中心的 VLA 路径因计算成本高昂而导致的性能瓶颈,通过优化设计提升了机器人动作解码的效率。
👍 12
Forecasts of explosive AI progress hinge on AI agents automating AI research. But evidence on whether agents can carry out open-ended AI research is thin. Current evaluations either test agents on narrow, verifiable tasks, which excludes open-ended research, or submit AI-generated papers to blind pe
中文介绍 一项研究通过两个案例,探讨了 AI 智能体是否具备进行开放式 AI 研究的能力。研究指出,目前关于智能体开展开放性研究的证据稀缺,现有评估多限于狭窄、可验证的任务。该研究旨在为评估 AI 智能体在更广阔、更具探索性研究场景中的表现提供初步证据。
👍 66
Evaluating whether a vision-language model (VLM) can act through a physical body is challenging. The outcome of an action couples the VLM's decision with motor control. When a task fails, it is hard to tell whether the VLM made a bad choice or the motor controller simply failed to execute it, e.g.,
中文介绍 论文提出了 HumanCLAW,旨在评估视觉-语言模型 (VLM) 是否能通过物理身体进行操作。研究强调,评估 VLM 身体动作的挑战在于 VLM 决策与运动控制的紧密耦合,导致任务失败时难以明确是 VLM 决策失误还是运动控制器故障。
👍 2
State-of-the-art retrieval models increasingly rely on closed training data, creating a reproducibility gap. We present an open end-to-end recipe for training retrieval models and study how English supervision transfers to multilingual retrieval through translate-train. We first reconstruct and cura
中文介绍 论文介绍了 DenseOn 和 LateOn,提供了一个端到端开放式检索模型训练方案。该方案专注于多语言、长上下文和代码搜索任务,并研究了如何通过「翻译-训练」方法,将英文监督数据应用于多语言检索,以解决现有检索模型对封闭训练数据依赖导致的复现性问题。
👍 15
LLM-based agents excel at software engineering tasks where an existing codebase provides context, but constructing a program from scratch remains fundamentally harder. Recent benchmarks such as ProgramBench quantify this gap: given only natural-language documentation and an execute-only binary as a
中文介绍 论文提出了 SpecFirst 方法,将行为规范的获取作为智能体从零开始程序合成的首要步骤。研究指出,尽管基于大语言模型的智能体在已有代码库情境下表现出色,但从头构建程序仍是重大挑战,ProgramBench 等基准测试也量化了这一差距。
👍 7
Large language model (LLM) agents are increasingly expected to assist users in completing tasks. However, existing benchmarks provide limited support for evaluating whether agents can carry out office-suite workflows at a reasonable cost. We introduce OmegaUse-OfficeVal, a benchmark for evaluating L
中文介绍 论文引入了 OmegaUse-OfficeVal 基准,旨在评估大语言模型 (LLM) 智能体在长周期办公套件任务中的表现,并纳入了经济效益考量。现有基准在评估智能体以合理成本完成办公流程方面支持有限,OmegaUse-OfficeVal 旨在弥补这一不足。
👍 17
Coding agents have made substantial progress on software engineering tasks that modify existing codebases, including bug fixing and feature implementation. However, constructing a complete program from scratch remains a major challenge: even the frontier models evaluated on ProgramBench fully resolv
中文介绍 论文提出了 MindForge,旨在通过无源代码程序合成,教授小型语言模型 (SLM) 全生命周期的软件工程能力。尽管编程智能体在修改现有代码(如修复错误、实现功能)方面取得了显著进展,但从零开始构建完整程序仍然是主要挑战。
👍 1
The growing capability of image generation models has made synthetic images a routine presence in open media, making robust and generalizable AI-Generated Image (AIGI) detection increasingly essential. While multi-modal large language models (MLLMs) offer a transparent alternative to black-box binar
中文介绍 鉴于 AI 生成图像日益普及,鲁棒且泛化能力强的 AIGI(AI 生成图像)检测变得至关重要。论文提出了 Veritas++,一种基于价值感知的策略蒸馏方法,旨在增强感知能力以有效检测 AIGI。多模态大语言模型 (MLLM) 也为此类检测提供了透明的替代方案。
👍 2
Adaptive rounding methods such as GPTQ, or equivalently Babai's nearest plane algorithm, round a real matrix to integers under a quadratic metric. They process the entries in a fixed order, one at a time, propagating each rounding error to the entries not yet processed through a triangular feedback
中文介绍 论文介绍了 GPTQ-2D,这是一种立方时间复杂度的双边自适应舍入方法。它基于 GPTQ(等同于 Babai 最近平面算法)的原理,在二次度量下将实矩阵舍入为整数。与传统方法不同,GPTQ-2D 旨在优化舍入误差的传播方式。
👍 1
Deep reinforcement policy learning directly in physical robots (on-robot learning) remains bottlenecked by slow wall-clock training times. We present SymmGrid, a trajectory level augmentation framework inspired by parallelized symmetries that super-scales group transformations to significantly accel
中文介绍 物理机器人上的深度强化策略学习受限于训练时间过长。论文提出了 SymmGrid 框架,通过并行对称性和自我-外在视觉感知,极大地扩展了机器人上的学习能力。SymmGrid 是一个轨迹级增强框架,旨在解决物理机器人直接学习的训练效率瓶颈。
👍 2
Large language models are increasingly used as decision aids whose probability judgments shape downstream choices. Whether those judgments carry a systematic directional tilt has been hard to detect: calibration metrics aggregate unsigned errors, and naturalistic uncertainty offers no ground-truth p
中文介绍 论文引入了 OptimismBench,一个旨在研究语言模型判断中预测偏差和对齐效应的基准。随着大型语言模型日益成为决策辅助工具,其概率判断影响后续选择。研究指出,由于校准指标聚合的是无符号误差,检测判断中是否存在系统性方向偏差一直很困难。
👍 0
Algorithmic news personalization in regional markets often fails because modern deep learning models require massive interaction data while real-world news has a short Time-to-Live (TTL < 48 h) and shallow article pools. This structural item cold-start deprives collaborative filtering of the data ne
中文介绍 论文提出了 Kairos,一种基于 Cholesky 分解的 LinUCB 方法,用于解决项目冷启动情况下的新闻推荐鲁棒性问题。在区域新闻市场中,由于新闻时效短 (TTL < 48 小时) 且文章池浅,依赖大量交互数据的深度学习模型常失效,导致结构性项目冷启动问题。
👍 0
Existing autoregressive video distillation methods commonly adopt a Distribution Matching Distillation (DMD)-based multi-stage pipeline. However, they typically decouple the initialization and DMD stages -- which then pursue different target distributions -- and judge the intermediate student mainly
👍 1
Large Language Model (LLM) agents are increasingly adopted in real-world security operations with access to host artifacts and command-line interfaces (CLIs), making it critical to thoroughly assess their security capabilities. However, existing cybersecurity benchmarks focus on pre-compromise setti
👍 18
Large language model agents often encounter related yet distinct tasks that share reusable solution patterns. Yet standard agentic reinforcement learning treats tasks as independent episodes, while existing approaches to skill learning either focus on repeated attempts of one task or use pipelines w
👍 0
Recent advances in AI agents have increasingly internalized native capabilities into their underlying foundation models, giving rise to multimodal foundation models and large reasoning models. However, agent memory is still primarily implemented through external modules, leaving the native memory ca
👍 12
Recent game world models can generate visually realistic and interactive environments conditioned on player actions. However, games are not defined by pixels alone; they are governed by explicit mechanics, namely state-dependent rules that control health reduction, skill activation, and game termina
👍 0
Reinforcement learning (RL) has shown remarkable success across a wide range of complex tasks. However, RL outcomes can be highly stochastic, and both expected performance and variability often depend on hyperparameter (HP) configurations. We propose efficient and risk-averse heteroscedastic Bayesia
👍 1
Post-training alignment is often shallow, eroding under fine-tuning. Whether midtraining interventions, cleanly isolated from post-training, can produce durable alignment remains untested. We test this via constitutional midtraining: inserting principled, values-based content into midtraining agains
👍 0
Speculative Decoding (SD) accelerates large language model inference by allowing a lightweight draft model to propose tokens that are subsequently verified in parallel by a larger target model. Recent approaches introduce lossy verification schemes to further improve efficiency by relaxing strict di
👍 0
World models offer a promising route toward robot planning by enabling agents to imagine and verify the consequences of actions before execution. However, current video-based world models often struggle to capture the physical constraints that govern manipulation, particularly contact. Further, thei
👍 0
Reliable visual safety understanding in real-world scenarios demands more than just object recognition; it requires causal reasoning under epistemic uncertainty. While Large Vision-Language Models (LVLMs) demonstrate impressive semantic alignment on standard benchmarks, they often struggle to distin
👍 0
Explicit graphics APIs expose memory dependencies, per-resource accesses, and image layouts. wgpu reconstructs and validates this state; Blade keeps Vulkan images in GENERAL, tracks no per-resource state, and issues global pass-boundary barriers. We isolate barrier placement and stage/access scope w
👍 0
Many discrete reasoning tasks, such as code generation, are inherently non-causal: programmers move between high-level structure and local details, a process we call any-order inference. For autoregressive language models, which lack a native any-order interface, non-causal abilities such as infilli
👍 5
We present Voice Memory, a inference-only scheme for agentic speech recognition: at stream time, a frozen corrector reads a single per-domain memory.md and decides per utterance whether to act on the hypothesis or abstain and keep the 1-best. Asynchronously, a score-gated optimizer revises that file
👍 0
Some security-development settings require local models that map an objective to an ordered, checkable plan. We present a low-rank decomposition adapter and release a case-disjoint corpus with 24 authored decompositions and 83 derived next-step examples across 24 satellite-security cases. To prevent
👍 0
Large language model (LLM) agents increasingly rely on invoking external tools to complete real-world tasks. Tool retrieval, which selects a small task-relevant subset from a library of thousands of tools before the agent acts, has therefore become a critical component of LLM agent pipelines. Howeve
👍 0
Human language is driven by unspoken beliefs and belief updates, making these critical to model for successful communication between large language models (LLMs) and their users. In this paper, we evaluate the ability of LLMs to recognize unspoken beliefs made through implicatures and to understand
👍 0
The deployment of embodied agents in self-driving laboratories could accelerate scientific discovery, yet their reliability is constrained by the irreversible and safety-critical nature of chemical experiments. Progress is further hindered by scarce failure data and the lack of fine-grained evaluati
👍 0
Recent image generators produce photo-realistic content that undermines the reliability of downstream recognition systems. As visual appearance cues become less pronounced, appearance-driven detectors that rely on forensic cues or high-level representations lose stability. This motivates a shift fro
See what your Claude Code sessions actually cost
中文介绍 LangWatch 推出一项新功能,旨在追踪用户使用 Claude Code 会话的实际成本。该工具帮助开发者和企业清晰了解其AI编码会话的费用,实现成本管理和优化。通过提供详细的成本洞察,LangWatch 致力于提高资源使用的透明度,让用户能更有效地利用Claude Code等大型语言模型进行开发。
Let every AI remember the same you.
中文介绍 Memmy Agent 是一款旨在解决AI间记忆不一致问题的产品。它允许用户创建一个统一的数字身份,确保所有AI助手都能记住并应用相同的用户偏好和历史信息。这有助于提升用户与多个AI助手交互时的连贯性和个性化体验,避免重复设置,从而提高AI助手的实用性。
Free voice coding for Claude Code, Codex and more
中文介绍 SKI 提供免费的语音编程功能,支持 Claude Code、Codex 等多种AI编程工具。该产品使用户能够通过语音指令进行代码编写,旨在提高编程效率并降低键盘操作的依赖。它为开发者提供了一种创新的交互方式,特别适合需要快速原型开发或有特殊输入需求的用户群体。
Guide users step by step inside your product.
中文介绍 NINA 是一款AI产品助手,旨在通过逐步指导用户完成产品内部操作。它能帮助新用户快速上手,理解产品功能,并有效提升用户体验和产品采用率。通过提供实时的、情境化的指引,NINA 减少了用户学习曲线,使产品操作更加直观和便捷,从而提高用户留存率。
254× cheaper sandbox alternative, powered by WebAssembly
中文介绍 agentOS 提供了一种基于 WebAssembly 的沙盒替代方案,宣称其成本比传统沙盒降低了 254 倍。该技术为开发者提供一个安全、隔离的环境来运行代码,同时大幅削减了运行成本。agentOS 的出现有望降低AI代理和自动化系统在安全测试和部署阶段的经济门槛,推动相关技术的发展和应用。
A tiny cat that watches your AI coding agents for you
中文介绍 tablo 是一款桌面小猫部件,其独特之处在于它能“观察”用户的AI编码代理。这款产品将趣味性和实用性结合,旨在以一种轻松的方式,为开发者提供AI编码代理运行状态的非侵入式反馈。它可能通过视觉提示或简单互动,让用户了解AI代理的工作情况,为编程过程增添一丝乐趣。
Where human life runs with AI
中文介绍 Expert Chase 是一款适用于 iOS 和 Android 平台的应用,其核心理念是“人类生活与AI并行”。该应用旨在将人工智能技术融入日常生活中,为用户提供智能化的帮助和服务。尽管具体功能未详述,但其目标是利用AI提升用户在移动设备上的体验,可能涵盖个人助理、信息管理或智能推荐等方面。
Turn YouTube into your personal learning platform
中文介绍 Focus Room 旨在将 YouTube 转化为用户的个人学习平台。这款工具通过提供专注模式、内容组织或智能推荐等功能,帮助用户更好地利用 YouTube 上的教育资源。它可能过滤掉干扰因素,突出学习内容,从而提升用户在观看视频时的学习效率和体验,有效管理和利用海量信息。
Photorealistic human video, powered by compact AI
中文介绍 CraftStory 是一款能够生成逼真人类视频的产品,其核心技术是紧凑型AI。这意味着它可能在资源消耗较少的情况下,高效地创造出高质量、视觉上难以辨别真伪的人物视频。这项技术在内容创作、营销宣传、虚拟形象等领域具有广泛应用潜力,能有效降低视频制作的门槛和成本。
Your personal assistant that lives in your texts
中文介绍 Pally 是一款个人助理应用,其独特之处在于它“生活在你的文本中”,即通过文本消息提供服务。这意味着用户可以通过日常的聊天界面与Pally互动,获取信息、管理任务或进行其他辅助操作。它旨在提供一种无缝、便捷的AI助理体验,将智能服务融入用户的日常沟通习惯。
中文介绍 YouTube博主Riley Brown发布了一期60分钟的视频教程,旨在帮助用户高效学习AI编程工具Cursor。该教程声称能将超过1000小时的学习内容浓缩呈现,覆盖从初学者到专业水平,使观看者能在短时间内全面掌握Cursor工具的使用技巧。
中文介绍 YouTube博主Riley Brown(通过Buzz AI)发布视频,探讨了人工智能模型Claude Code与Codex现已能够协同工作。该视频内容可能关注如何整合并利用这两种AI模型,以实现更强大的编程辅助功能或解决复杂的编码问题,标志着AI工具协作能力的新进展。
中文介绍 由Riley Brown制作发布的这份YouTube视频教程,旨在为初学者提供一份完整指南,详细讲解如何有效利用人工智能模型Claude来辅助和优化Excel电子表格的操作。该视频内容将聚焦于演示Claude在数据处理、分析等方面的实际应用技巧,帮助用户掌握将AI工具与Excel结合使用的基本方法。
中文介绍 YouTube 视频指出,「Opus 5」已推出,但新的 Claude 语音功能「Claude Voice」被认为是更重要的进展。视频强调,虽然「Opus 5」已发布,但这一全新的 Claude 语音技术被认为具有更大的影响力。
中文介绍 OpenAI 发布了其名为 Codex Voice 的新产品。该产品被描述为类似电影中「贾维斯」(Jarvis)的人工智能系统,暗示它可能具备先进的语音交互或智能助手功能,代表了AI在自然语言处理和人机互动方面的新进展。
中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 中文AI模型Kimi的K3版本据称「颠覆了AI经济学」。标题表明Kimi K3在人工智能领域可能带来了成本效益或性能上的重大突破,对AI行业的经济模式产生了显著影响。
6 回复 · 程序员 节点
75 回复 · 程序员 节点
18 回复 · 程序员 节点
23 回复 · 程序员 节点
44 回复 · Apple 节点
8 回复 · Apple 节点
8 回复 · Apple 节点
27 回复 · Apple 节点
39 回复 · Apple 节点
12 回复 · Apple 节点
该源今日无内容。
10 points · 4 comments
405 points · 245 comments
76 points · 8 comments
75 points · 39 comments
We recently used DeepSeek V4 Flash as a teacher for finance tasks with GPT-OSS-120B. Distillation works well on this problem. At a constrained 8k token budget, our self-distilled 120B scores 83.61% on FinanceReasoning, above Kimi K3 (81.93%) and Inkling (65.13%). We released the 20B open weights. Wi
71 points · 17 comments
209 points · 119 comments
393 points · 257 comments
308 points · 148 comments
1 points · 0 comments
36 points · 38 comments
254 points · 96 comments
22 points · 2 comments
133 points · 67 comments
380 points · 339 comments
149 points · 71 comments
105 points · 20 comments
66 points · 75 comments
72 points · 121 comments
Hi HN, we're Marinos and Hudson, founders of Prized (https://prized.dev)! Prized lets non-engineer employees describe the internal tool they need and get a full-stack app, wired to their company’s data and deployed behind the company’s sign-in, without them ever juggling API keys or c
135 points · 37 comments
109 points · 34 comments
143 points · 165 comments
188 points · 213 comments
297 points · 368 comments
hi HN,I built supapool.io, an ephemeral full copy of supabase's services that you can spin up in ~400 ms (Auth, postgres, storage, realtime).so if you run multiple coding agents in parallel in different worktrees, they can now have their own copy of supabase without making changes that conflict
19 points · 2 comments
Hi HN, we built world-model-optimizer, an open source tool to continually improve a specialized model for an agent.It does this by simulating production tool responses through text world modeling (similar to QwenAgentWorld, summary here https://x.com/silennai/status/20738874
50 points · 5 comments
106 points · 72 comments
What's changed Bug fixes and reliability improvements
中文介绍 Anthropic 旗下的 Claude Code 项目发布了 v2.1.220 版本。此次更新主要内容为错误修复和可靠性改进,旨在提升软件的稳定性和用户体验。
What's changed Added Claude Opus 5 (claude-opus-5), now the default Opus model — 1M context, fast mode at $10/$50 per Mtok Added sandbox.network.strictAllowlist setting to deny non-allowlisted hosts for sandboxed commands without prompting Added DirectoryAdded hook that fires after /add-dir or the S
中文介绍 Anthropic的Claude-code项目发布v2.1.219更新。此版本引入了Claude Opus 5(claude-opus-5)作为默认Opus模型,具备1M上下文。其快速模式定价为每百万token $10/$50。同时,更新新增“sandbox.network.strictAllowlist”设置,增强沙盒命令的网络安全。
What's changed Changed /code-review to run as a background subagent, so review work no longer fills your conversation and keeps stacked slash commands as its review target Added screen-reader announcements of deleted text for word and line deletions (Option+Delete, Ctrl+W, Cmd+Backspace, Ctrl+U, Ctr
What's changed Added emoji shortcode autocomplete in the prompt input: type :heart: to insert ❤️, or :hea for suggestions — disable with the emojiCompletionEnabled setting Added warnings when transcript writes are failing (e.g. disk full) or when session saving is off due to an inherited environment
What's changed Added sandbox.filesystem.disabled setting to skip filesystem isolation while keeping network egress control Fixed a slowdown in long sessions where message normalization cost grew quadratically with the number of turns, causing multi-second stalls and slow resumes Fixed auto mode deny
What's changed Claude no longer runs the /verify and /code-review skills on its own; invoke them with /verify or /code-review when you want them
What's changed Fixed single-segment dir/** allow rules like Edit(src/**) auto-approving writes to nested dir/ directories anywhere in the tree instead of only /dir Fixed a permission-check bypass affecting commands run in Windows PowerShell 5.1 sessions Fixed Bash permission checks to fail closed on
What's changed /fork now copies your conversation into a new background session (its own row in claude agents) while you keep working; the in-session subagent it used to launch is now /subtask Added claude auto-mode reset to restore the default auto-mode configuration, with a confirmation prompt (pa
What's changed Added --forward-subagent-text flag and CLAUDE_CODE_FORWARD_SUBAGENT_TEXT environment variable to include subagent text and thinking in stream-json output Fixed permission previews relayed to chat channels not neutralizing bidirectional-override, zero-width, and look-alike quote charac
What's changed Added a live elapsed-time counter to the collapsed tool summary line so long-running tool calls visibly tick instead of looking stuck Added a startup warning for Write(path), NotebookEdit(path), and Glob(path) permission rules — use Edit(path) or Read(path) instead Fixed isolation: 'w
Release 0.147.0-alpha.2
中文介绍 OpenAI旗下的Codex项目近日发布了其Rust语言版本的最新更新,版本号为v0.147.0-alpha.2。此次发布代表了该项目在Rust生态系统中的持续迭代和发展。
Release 0.146.0-alpha.9.2
中文介绍 OpenAI旗下的Codex项目发布了其Rust语言版本的更新,版本号为v0.146.0-alpha.9.2。此次发布是该项目在Rust生态系统中的又一次迭代。
Release 0.146.0-alpha.9.1
中文介绍 OpenAI旗下的Codex项目发布了其Rust语言版本的更新,版本号为v0.146.0-alpha.9.1。这标志着Codex项目在Rust生态系统中的持续发展。
Release 0.147.0-alpha.1
中文介绍 OpenAI Codex近日发布了其`rust-v0.147.0-alpha.1`版本。此为该项目的一个早期测试阶段性发布,通常用于内部测试或有限用户试用,以收集反馈并进一步完善功能。
New Features Name new sessions with /new or /clear, pin important threads, and switch between side conversations without closing them. (#34605, #34840, #35011) Support Agent Plugins manifests, workspace plugin publishing, and additional plugin marketplaces for Amazon Bedrock and Claude Code. (#35105
中文介绍 OpenAI Codex正式发布`rust-v0.146.0`版本,带来多项新功能。用户现在可通过`/new`或`/clear`命令命名新会话、置顶重要线程,并在不关闭侧边对话的情况下进行切换。新版本还支持Agent插件清单、工作区插件发布,并增加了对Amazon Bedrock等额外插件市场的支持。
Update rusty_v8 to 150.4.0 (#35831) ## What changed - Upgrade the Rust `v8` crate to `150.4.0` and the Bazel V8 source to `15.0.245.2`. - Refresh the prebuilt archives, checksums, LLVM source revisions, Bazel targets, and downstream V8 patches for the new release. - Expose the pinned llvm-libc heade
中文介绍 OpenAI Codex发布`rusty-v8-v150.4.0`版本,主要更新了其核心依赖。该版本将Rust `v8` crate升级至`150.4.0`,并将Bazel V8源更新至`15.0.245.2`。同时,为配合新版本,还刷新了预构建归档、校验和、LLVM源修订等相关组件。
Release 0.146.0-alpha.16
中文介绍 OpenAI Codex发布了`rust-v0.146.0-alpha.16`版本。这是该项目在`0.146.0`主版本之前的一个第16个alpha测试版本,旨在逐步引入新功能并进行内部测试和验证。
Release 0.146.0-alpha.15
中文介绍 OpenAI Codex项目近日发布了其针对Rust语言的v0.146.0-alpha.15版本。这是Codex项目的早期alpha测试版本,表明该项目在Rust语言支持和相关工具开发上的持续进展与迭代。此次更新旨在向开发者提供最新的功能或改进,以进行测试和反馈。
Release 0.146.0-alpha.14
中文介绍 OpenAI Codex项目于近期发布了针对Rust语言的v0.146.0-alpha.14版本。作为该项目的早期alpha测试版,此次发布体现了OpenAI在Codex对Rust语言的支持和工具链方面的持续开发工作。此次更新旨在向开发者提供最新的功能改进,以便进行评估和测试。
Release 0.146.0-alpha.13
中文介绍 OpenAI Codex项目在其GitHub页面发布了新的软件版本,编号为0.146.0-alpha.13。这是一个Rust语言相关的alpha预发布版本,但新闻稿中未提供此版本包含的任何具体更新内容、功能改进或错误修复的详细信息。
今日AI圈呈现多元发展态势:一方面,实时视觉语言动作模型和多语言搜索模型等专用AI模型取得显著突破,AI编程工具集成与成本优化亦有进展;另一方面,OpenAI大幅降价引发行业价格战,而对未来AI发展方向(尤其是训练数据投资)的深度思考也成为焦点。
论文介绍了名为 TurboVLA 的新型视觉-语言-动作 (VLA) 模型,在 NVIDIA RTX 4090 上实现了 32 Hz 的实时运行,显存占用低于 1GB。该模型旨在通过优化设计提升机器人动作解码效率,解决传统以大语言模型为中心的 VLA 路径计算成本高昂的性能瓶颈。TurboVLA 的创新使其在低资源环境下也能进行高效的机器人控制与交互,是机器人学领域的重要进展。
论文发布了 DenseOn 和 LateOn,一套端到端开放式检索模型训练方案。该方案专注于多语言、长上下文及代码搜索任务,并研究了「翻译-训练」方法如何将英文监督数据应用于多语言检索。此举旨在解决现有检索模型过度依赖封闭训练数据导致的可复现性问题,为开发者提供了更透明、更具扩展性的检索技术,促进了开放AI在信息检索领域的应用。
论文提出了 MindForge,旨在通过无源代码程序合成方法,赋予小型语言模型 (SLM) 全生命周期的软件工程能力。尽管现有编程智能体在修改现有代码(如错误修复、功能实现)方面表现出色,但从零开始构建完整程序仍是一项重大挑战。MindForge 的目标是弥补这一差距,使 SLM 能够自主完成从需求分析到代码生成的整个软件开发流程,预示着编程智能体的未来发展方向。
Hugging Face 的 `speech-to-speech` 项目推出一套工具和方法,旨在帮助开发者利用开源模型构建本地运行的语音代理。它专注于实现高质量的语音到语音转换,使用户能够在设备本地部署智能语音交互系统。该项目有效解决了云端语音服务可能存在的隐私、延迟和成本问题,适用于智能家居、车载系统等需定制化、低延迟或离线语音助手的场景,赋能开发者创新。
OpenAI Codex 正式发布 `rust-v0.146.0` 版本,带来多项核心功能升级。新版本允许用户通过 `/new` 或 `/clear` 命令命名新会话、置顶重要线程,并在不关闭侧边对话的情况下进行切换。此外,新版本还支持 Agent 插件清单、工作区插件发布,并增加了对 Amazon Bedrock 等额外插件市场的支持,显著提升了开发者在使用 Codex 进行编码时的效率和灵活性。
`openwork` 作为一个开源项目,旨在提供类似 Claude Cowork 的 AI 协作助手替代方案。它提供了一个可定制和私有化部署的平台,支持团队进行内容创作、信息总结、任务管理等。该项目解决了企业对专有 AI 工具可能存在的、数据隐私、厂商锁定及定制化不足的担忧,特别面向寻求构建自主可控 AI 协作环境的团队,并支持集成各类开源大语言模型。
`agentOS` 推出一种基于 WebAssembly 的沙盒替代方案,宣称其运行成本比传统沙盒降低了 254 倍。这项技术为开发者提供一个安全、隔离的环境来运行代码,同时大幅削减了运行开销。`agentOS` 的出现有望显著降低 AI 代理和自动化系统在安全测试和部署阶段的经济门槛,从而推动相关技术更广泛的发展和应用,尤其在边缘计算和分布式系统中具有潜力。
CraftStory 推出一款能生成逼真人类视频的产品,其核心技术为紧凑型 AI。这意味着它能够在消耗较少资源的情况下,高效地创造出高质量、视觉上难以辨别真伪的人物视频。这项技术在内容创作、营销宣传、虚拟形象等领域具有广泛应用潜力,能有效降低视频制作的门槛和成本,为企业和个人提供更便捷、更具影响力的视频内容生产解决方案。
OpenAI 宣布自7月30日起,其 GPT-5.6 Luna 模型价格将大幅下调 80%,Terra 模型下调 20%。OpenAI 解释称,顶级 Sol 模型提高了公司基础设施效率,同时面对中国廉价供应商及微软的激烈竞争,促成了此次降价。此次策略性降价旨在提升市场竞争力,扩大用户群体,可能引发 AI 模型市场新一轮的价格战,对整个行业生态产生深远影响。
专注于合成用户技术的初创公司 Simile,在完成 1 亿美元 A 轮融资仅 5 个月后,再次成功募得 2 亿美元,公司估值飙升至 20 亿美元,正式跻身 AI「独角兽」行列。Simile 的快速崛起显示了市场对合成数据和虚拟用户解决方案的强劲需求。这笔巨额投资将进一步推动 Simile 在该领域的技术创新与市场扩张,预示着合成用户技术在未来将扮演更关键的角色。
谷歌宣布,得益于大型语言模型 (LLM) 等 AI 工具的应用,其在六月份修复的 Chrome 浏览器漏洞数量,超过了过去两年修复的总和。这一成就凸显了 AI 在软件开发和安全领域日益增长的效用。微软等科技巨头也正通过集成 AI 工具,加速漏洞发现和修补流程,预示着 AI 将成为未来软件维护和安全保障不可或缺的核心技术。
前 OpenAI 研究员 Andrew Ho 和剑桥大学的 Adam Hunt 指出,大语言模型正日益专业化,在编码和数学领域表现优异,但在其他领域则停滞甚至退步。Ho 预测,未来将有 1000 亿美元投入训练数据,因为仅靠模型规模扩张已不足以持续提升性能。这一观点强调了高质量、专业化训练数据对于 AI 模型未来发展的关键作用,预示着 AI 行业将迎来数据驱动的新投资浪潮。
YouTube 博主 Riley Brown 发布了一期 60 分钟的视频教程,旨在帮助用户高效学习 AI 编程工具 Cursor。该教程声称能将超过 1000 小时的学习内容浓缩呈现,覆盖从初学者到专业水平,使观看者能在短时间内全面掌握 Cursor 工具的使用技巧。该教程为开发者提供了快速入门并精通 AI 辅助编程的途径,有效降低了学习门槛,提升了生产力。
YouTube 博主 Riley Brown(通过 Buzz AI)发布视频,探讨了人工智能模型 Claude Code 与 Codex 现已能够协同工作。该视频内容可能关注如何整合并利用这两种 AI 模型,以实现更强大的编程辅助功能或解决复杂的编码问题。这一进展标志着 AI 工具协作能力的新篇章,为开发者提供了更灵活、更强大的 AI 编程解决方案,有望加速代码开发效率和质量。
Microsoft 的 `AI-For-Beginners` 是一个为期 12 周、包含 24 节课程的全面人工智能学习路径,旨在普及 AI 知识,面向所有希望入门 AI 的学习者。该课程涵盖人工智能核心概念、机器学习、深度学习、自然语言处理和计算机视觉等关键领域。它通过实践项目和清晰讲解,帮助初学者逐步建立 AI 知识体系和动手能力,解决了传统 AI 学习门槛高的问题,非常适合学生和开发者。
今天的 AI 产品聚焦于智能体的精细化开发与应用,从核心能力的优化到部署环境的降本增效,以及多模态创作和个人效率工具的革新,共同描绘了 AI 技术日益深入工作流和日常生活的趋势。
Memmy Agent 旨在解决 AI 间记忆不一致问题。它允许用户创建一个统一的数字身份,确保所有 AI 助手都能记住并应用相同的用户偏好和历史信息。这有助于提升用户与多个 AI 助手交互时的连贯性和个性化体验,避免重复设置,从而提高 AI 助手的实用性,是构建未来多 AI 助理生态的关键一步。
CraftStory 是一款能够生成逼真人类视频的产品,其核心技术是紧凑型 AI。这意味着它可能在资源消耗较少的情况下,高效地创造出高质量、视觉上难以辨别真伪的人物视频。这项技术在内容创作、营销宣传、虚拟形象等领域具有广泛应用潜力,能有效降低视频制作的门槛和成本,赋能更多非专业用户进行高质量视频制作。
这是一个 AI 代理技能,能迅速在 Reddit、X、YouTube、Hacker News、Polymarket 及整个互联网上研究任意话题,并综合生成一份基于事实的摘要。主要用于获取过去 30 天的最新信息,解决信息过载问题,帮助用户快速了解热点动态和事件。它为研究人员和内容创作者提供了一个强大的信息聚合和分析工具,显著提升了市场趋势和公众舆论追踪的效率。
openwork 是一个开源项目,旨在作为类似 Claude Cowork 的 AI 协作助手的替代方案。它提供了一个可定制和私有化部署的平台,帮助团队进行内容创作、信息总结、任务管理等,解决了对专有 AI 工具数据隐私、厂商锁定及定制化不足的担忧。主要面向希望构建自主可控 AI 协作环境的企业、开发者或寻求增强数据安全性的团队,支持集成各类开源大语言模型。
`chrome-devtools-mcp` 是专为「编码代理」(coding agents)设计的 Chrome DevTools 扩展。它将 Chrome DevTools 强大的调试和分析能力引入到 AI 编码代理的开发流程中,帮助开发者监控、理解和优化代理的行为与输出。通过这些工具,开发者可以更有效地调试由 AI 生成或处理的代码,提升编码代理的开发效率和准确性,是 AI 代理开发的关键基础设施。
`ECC` 是一个全面的 AI 代理性能优化系统,旨在为 Claude Code、Codex、Opencode 和 Cursor 等多种大型语言模型(LLM)驱动的代理提供增强功能。它专注于提升代理的技能、直觉、记忆、安全性,并采用研究优先的开发方法,以构建更强大、高效且可靠的 AI 代理。该项目适合开发和部署高级 AI 代理的工程师和研究人员,特别是在需要整合多模态能力和优化代理行为的场景中。
agentOS 提供了一种基于 WebAssembly 的沙盒替代方案,宣称其成本比传统沙盒降低了 254 倍。该技术为开发者提供一个安全、隔离的环境来运行代码,同时大幅削减了运行成本。agentOS 的出现有望降低 AI 代理和自动化系统在安全测试和部署阶段的经济门槛,推动相关技术的发展和应用,使得更多创新型 AI Agent 能够以更经济的方式部署和测试。
AI Search Console 提供针对 AI 搜索的提示分析和引用映射功能。该工具旨在帮助用户和开发者更好地理解和优化 AI 搜索的性能,包括分析用户提示的效果以及追踪 AI 生成内容所引用的来源。这对于提升 AI 搜索结果的准确性、可信度及用户体验具有重要意义,有助于开发者进行精细化管理和迭代,确保 AI 搜索结果的透明度和可追溯性。
LangWatch 推出一项新功能,旨在追踪用户使用 Claude Code 会话的实际成本。该工具帮助开发者和企业清晰了解其 AI 编码会话的费用,实现成本管理和优化。通过提供详细的成本洞察,LangWatch 致力于提高资源使用的透明度,让用户能更有效地利用 Claude Code 等大型语言模型进行开发,从而更好地进行预算规划和资源调配。
NINA 是一款 AI 产品助手,旨在通过逐步指导用户完成产品内部操作。它能帮助新用户快速上手,理解产品功能,并有效提升用户体验和产品采用率。通过提供实时的、情境化的指引,NINA 减少了用户学习曲线,使产品操作更加直观和便捷,从而提高用户留存率,是提升产品价值和用户体验的智能利器。
SKI 提供免费的语音编程功能,支持 Claude Code、Codex 等多种 AI 编程工具。该产品使用户能够通过语音指令进行代码编写,旨在提高编程效率并降低键盘操作的依赖。它为开发者提供了一种创新的交互方式,特别适合需要快速原型开发或有特殊输入需求的用户群体,也为无障碍编程提供了新途径。
Pally 是一款个人助理应用,其独特之处在于它「生活在你的文本中」,即通过文本消息提供服务。这意味着用户可以通过日常的聊天界面与 Pally 互动,获取信息、管理任务或进行其他辅助操作。它旨在提供一种无缝、便捷的 AI 助理体验,将智能服务融入用户的日常沟通习惯,让用户在不切换应用的情况下即可获得 AI 帮助。
Sorinai 是一款专为会议设计的交互式 AI 记事本。它利用人工智能技术,帮助用户在会议中高效记录、整理和管理信息。该产品可能具备实时语音转文本、自动总结要点、识别发言人等功能,旨在提升会议效率和信息捕获能力,让与会者能更专注于讨论而非记录,同时确保关键信息的完整性和可检索性。
tablo 是一款桌面小猫部件,其独特之处在于它能「观察」用户的 AI 编码代理。这款产品将趣味性和实用性结合,旨在以一种轻松的方式,为开发者提供 AI 编码代理运行状态的非侵入式反馈。它可能通过视觉提示或简单互动,让用户了解 AI 代理的工作情况,为编程过程增添一丝乐趣,是探索 AI 助手可视化和互动体验的一个有趣尝试。