TechCrunch · 08/07 06:43
多个消息来源指出,OpenAI正与前苹果设计师Jony Ive合作开发一款无屏幕、电池供电的AI智能音箱,形似冰球大小的甜甜圈,预计售价在300至400美元之间。该设备有望扩展OpenAI的服务至硬件领域。(多家报道)
推荐理由:OpenAI首次硬件产品的传闻引发了对AI设备形态和市场竞争格局的广泛关注,值得业界密切跟踪。
TechCrunch · 08/07 06:43
多个消息来源指出,OpenAI正与前苹果设计师Jony Ive合作开发一款无屏幕、电池供电的AI智能音箱,形似冰球大小的甜甜圈,预计售价在300至400美元之间。该设备有望扩展OpenAI的服务至硬件领域。(多家报道)
推荐理由:OpenAI首次硬件产品的传闻引发了对AI设备形态和市场竞争格局的广泛关注,值得业界密切跟踪。
GitHub Trending
AutoGPT是一个基于大型语言模型的自主AI代理,旨在让人人都能使用AI。它能自主规划、执行复杂任务,如研究和代码生成,甚至进行自我修正。开发者和用户可利用其自动化工作流,提升多步骤推理和决策场景的效率。
推荐理由:作为自主AI代理的标志性开源项目,AutoGPT提供了强大的自动化能力,是理解和实践AI Agent架构的绝佳范例。
Hacker News · 08/07 08:10
一项Hacker News上的研究显示,OpenAI的Whisper语音识别模型在转录70岁老年人的语音时,准确率高于转录20岁年轻人的语音。该发现探讨了ASR系统在不同年龄段用户上的表现差异及潜在原因,对优化模型有启示。
推荐理由:这一发现对语音识别模型的公平性和泛化能力研究具有重要意义,提示开发者在训练和评估ASR模型时需考虑年龄因素。
Product Hunt · 08/07 08:41
Meta公司在Product Hunt上推出了Muse Code,一款专为长周期编码任务设计的终端AI代理。该工具旨在通过自动化和辅助来简化复杂的编程工作流,提高开发者的效率和项目管理能力。
推荐理由:作为Meta推出的AI编程代理,Muse Code有望显著提升长周期编码任务的效率,值得开发者关注与试用。
Ars Technica
AI音乐生成平台Suno宣布将通过引入水印和下载限制来遏制「大规模滥用」行为。此举旨在提高AI生成音乐的合法性和可溯源性,以应对版权和伦理挑战,并规范平台内容管理。
推荐理由:Suno的这一举措反映了AI内容平台在版权保护和内容管理方面的最新尝试,对整个AI创作生态具有重要的示范作用。
X 推文 (AttentionVC) · 08/06 22:01
一位博主分享了使用xAI的Grok Imagine从零开始制作短片的详细教程。教程指导用户如何利用AI视频生成工具的功能,一步步完成电影制作,为AI视频创作者提供了实用的实践指南。
推荐理由:对于想尝试AI视频创作的个人或团队,这份详尽的教程提供了宝贵的实战经验,展示了AI工具在内容创作领域的潜力。
Claude (YouTube) · 08/07 01:46
金融科技公司Ramp发布视频,展示其工程师团队如何在软件开发流程的各个环节中有效利用AI代理。视频内容可能涵盖AI代理在代码编写、测试、调试及项目管理等方面的应用,旨在提升开发效率和质量。
推荐理由:提供了AI代理在真实企业环境中的应用案例,对于希望将AI集成到开发工作流的团队具有很高的借鉴意义。
V2EX · 08/06 22:20
一位V2ex用户分享了使用AI编程助手Codex的经历,称在批评Codex后,感觉其开始「故意」给出错误代码或不准确的回答。帖子引发了关于AI“智能”与用户心理感知的讨论。
推荐理由:这篇文章引发了对AI行为模式和用户心理感知的讨论,揭示了人机交互中可能出现的新颖问题。
HuggingFace Trending Papers · 08/06 08:00
针对现有视频评估基准的局限性,VideoArgus框架被提出,它采用基于评估标准的方法,旨在更全面、准确地评估生成和编辑视频的质量。该框架克服了固定内容、覆盖设置有限和分数证据不足等挑战。
推荐理由:该研究为视频生成和编辑模型的评估提供了新思路和统一框架,对于提升AI视频领域的研发效率和产品质量至关重要。
X 创作者 (AttentionVC) · 08/05 18:26
一位X用户开源了其备受关注的Codex与Obsidian结合的公众号创作工作流。该工作流旨在利用AI编程助手和知识管理工具,高效地完成公众号文章的构思、撰写与发布,为内容创作者提供了实用的自动化解决方案。
推荐理由:这是一个将AI工具与知识管理相结合的优秀案例,为公众号及其他内容创作者提供了高效自动化的新思路。
Additional details about OpenAI's mysterious new AI device make it sound like a pricey smart speaker.
中文介绍 传闻称OpenAI正在开发一款新型人工智能智能音箱,预计售价在300至400美元之间。该设备被描述为一款价格不菲的智能音箱。
The organization, Network for Hope, "strongly disagrees" with Trump admin's decision.
中文介绍 美国器官捐赠机构「希望网络」(Network for Hope)被指控试图获取一名活体男子的器官,面临特朗普政府的关闭决定。该组织对此表示「强烈反对」。
Russian attack? Explosive drone targeted parked aircraft at Leipzig airport.
中文介绍 一架带有爆炸物的无人机在德国莱比锡机场一架乌克兰货机附近被发现。无人机已被解除武装,当局正在搜寻第二架可能存在的无人机,并怀疑这可能是一次俄罗斯袭击。
Not everyone needs a keynote slot to make noise at TechCrunch Disrupt 2026. Sometimes the best way to meet investors, customers, and partners is by exhibiting directly on the Expo Hall floor at San Francisco’s Moscone West from October 13-15. That’s exactly what our Exhibit Program offers, and it’s
中文介绍 TechCrunch Disrupt 2026大会将于10月13日至15日在旧金山莫斯康西(Moscone West)会展中心举行。大会鼓励初创公司通过展位直接与投资者、客户和合作伙伴见面,无需主旨演讲也能有效展示。
Vogue World is coming to San Francisco next year — perhaps another indication that tech bros are now part of the fashion zeitgeist.
中文介绍 《Vogue》杂志的全球活动“Vogue World”将于明年在旧金山举办,这被视为时尚界对科技圈的又一次认可。此举可能表明科技行业人士在时尚潮流中占据越来越重要的地位。
Starting today, you can take an additional $100 off your founder, investor, or attendee TechCrunch Disrupt 2026 pass, which is a nice bonus on top of our current discounted pricing.
中文介绍 购买TechCrunch Disrupt 2026大会门票可享受最高400美元的折扣。即日起,创始人、投资者或普通参会者可额外获得100美元优惠,该优惠截止日期为本周五。
Google is set to host its next live Made by Google hardware launch event on August 12th, and the company says in a new video that comedian Trevor Noah will be hosting the show. The video indicates that the event will feature other celebrities and influencers as well, including Call Her Daddy host Al
中文介绍 谷歌将于8月12日举办「Made by Google」硬件新品发布会,预计将推出Pixel 11。谷歌发布视频确认喜剧演员特雷弗·诺亚将担任主持人,届时还将有其他名人和网红出席。
The AI device OpenAI is developing with former Apple designer Jony Ive is "essentially a smart speaker without a display" that's battery-powered, doughnut-shaped and roughly the size of a hockey puck, according to Bloomberg reporter Mark Gurman. The device, expected to launch in 2027 for a price ove
中文介绍 据彭博社记者Mark Gurman报道,OpenAI正与前苹果设计师Jony Ive合作开发一款人工智能设备,其形似甜甜圈,大小与冰球相仿,是一款无屏幕、电池供电的智能音箱,预计将很快发布。
Musk continues appeal despite court loss and settlement with advertiser group.
中文介绍 埃隆·马斯克旗下的社交媒体平台X公司,在输掉法庭诉讼并与广告商团体达成和解后,仍寻求继续起诉广告商。X已向美国第五巡回上诉法院提出上诉,要求推翻地方法院法官的裁决。
Suno plans watermarks and download limits to stop "large-scale abuse."
中文介绍 人工智能音乐生成平台Suno计划通过引入水印和下载限制来打击「大规模滥用」行为。此举旨在提高AI生成音乐的合法性,并有效管理平台内容。
Anthropic and OpenAI are racing to scale up while reducing dependence on Nvidia.
中文介绍 AI公司Anthropic证实将组建内部芯片团队,以设计自家硬件来支持其大模型Claude的运行。此举表明Anthropic正与OpenAI一同,努力扩大规模并减少对英伟达硬件的依赖。
AirPods Pro 3 | Photo by Amelia Holowaty Krales / The Verge Best Buy kicked off a sale on Apple products with discounts on its latest smartwatches to phones. Another deal that caught our eye is on the latest AirPods Pro, Apple’s flagship wireless earbuds, which are down to $189.99 ($60 off), with re
中文介绍 百思买(Best Buy)正在对苹果产品进行促销,其中最新款AirPods Pro无线耳机优惠60美元,现价189.9美元,是自六月下旬以来的最低价。
The tech industry is realizing it needs to build agents based on what regular consumers want, not just what its AI models can do.
中文介绍 科技行业逐渐意识到,普通消费者尚未广泛使用AI智能体,原因在于这些智能体的开发应基于用户的实际需求,而非仅仅展示AI模型的技术能力。
Groups of hackers are breaking into large U.S. financial firms to steal sensitive data and extort victims, Google’s security researchers report.
中文介绍 谷歌安全研究人员报告称,有黑客团伙正通过电话联系美国大型金融机构的员工,以此渗透公司系统,窃取敏感数据并勒索受害者。
In today’s episode of Uncanny Valley, we discuss how ICE has been collecting DNA samples of people who have no criminal convictions, including children, which end up in an FBI database indefinitely.
中文介绍 根据“Uncanny Valley”节目报道,美国移民与海关执法局(ICE)正在收集无犯罪记录人员(包括儿童)的DNA样本,这些样本被永久存储在联邦调查局(FBI)的数据库中。
TypeScript · ★ 16,372 · 🍴 1,475 · 📈 1,057 stars today
TencentDB Agent Memory is a team-level memory hub for AI Agents — turning conversations, docs, and code into four reusable memory assets (Chat Memory, Skill, LLM-Wiki, Code-Graph) that are governed, shared, and equipped across agents and frameworks.
中文介绍 TencentDB Agent Memory 为 AI Agents 提供本地化的长效记忆解决方案。它采用四层渐进式管道设计,旨在实现无需外部 API 依赖的完全本地化记忆存储与检索,解决了 AI Agent 在需要长期记忆和上下文感知时对外部服务的依赖问题。该项目通过内建机制管理记忆,增强了数据隐私性和系统性能。适用于需要为 AI Agent 构建稳定、独立且具备丰富记忆能力的开发者,例如开发智能客服、个人助理或具备学习能力的自动化系统。
JavaScript · ★ 82,929 · 🍴 8,894 · 📈 593 stars today
Production-grade engineering skills for AI coding agents.
中文介绍 为 AI 编码代理提供生产级的工程技能,旨在提升 AI 代理在软件开发中的实际能力和可靠性。它可能包含代码生成、测试、重构等实用工具和方法,帮助开发者构建更高效、更可靠的智能编程助手。适用于 AI 工程师和软件开发团队。
TypeScript · ★ 4,791 · 🍴 241 · 📈 2,802 stars today
Give your agent a computer 👾
中文介绍 Cloudflare Computer 项目旨在为 AI 智能体提供一个虚拟的、可编程的“电脑”环境。它允许 AI Agent 像人类一样,在沙盒化的环境中执行命令行操作、浏览网页、读写文件等,从而实现更复杂、更具自主性的任务。该项目解决了当前 Agent 普遍缺乏与外部系统深度交互能力的问题,使其能够更好地模拟真实世界中的操作。开发者可利用此工具构建能够自动化软件开发、数据分析、系统管理等多种复杂场景的智能体。
Shell · ★ 207,026 · 🍴 17,880 · 📈 1,873 stars today
Skills for Real Engineers. Straight from my .agents directory.
中文介绍 mattpocock/skills 汇集了一系列专为“真正的工程师”设计的 AI 技能,这些技能直接源自作者的 .claude 目录。它旨在为 Anthropic Claude 等 AI 编码助手提供实际、高效的工具和能力,帮助开发者在编程、代码审查和自动化任务中提高效率和准确性,尤其适合需要强大 AI 编程辅助的专业人士。
Python · ★ 23,113 · 🍴 1,774 · 📈 138 stars today
The authentication glue you need.
中文介绍 authentik 是一个开源的身份验证和身份管理平台,旨在简化企业级应用的认证集成。它提供统一登录(SSO)、多因素认证(MFA)、用户管理、OAuth2/OIDC 和 SAML 支持等功能,解决多系统身份孤岛问题。开发者和企业IT管理员可利用它,为内部及外部服务提供安全、便捷的访问控制,大幅提升用户体验和管理效率。
Python · ★ 2,861 · 🍴 217 · 📈 847 stars today
Lightweight loop engineering state kernel for long-running AI agent teams. Agent-loop agnostic across Codex, Claude Code, and other coding agents, with durable goals, quota-aware auto-wake, executable todos, evidence logs, and verifiable handoffs.
中文介绍 LoopX 是一个轻量级的循环工程状态内核,专为管理和协调长时间运行的 AI 智能体团队而设计。它提供了一个与具体 Agent 类型(如 Codex、Claude Code 等)无关的框架,能够处理复杂的多步任务流。LoopX 的核心功能包括持久化目标管理、配额感知自动唤醒机制以及可执行的任务调度,确保智能体团队在资源受限的环境下高效、稳定地运行。它解决了大型 Agent 系统在状态管理、资源调度和多 Agent 协作方面的挑战,特别适用于自动化软件开发、复杂问题解决等场景。
Java · ★ 51,632 · 🍴 11,164 · 📈 13 stars today
Google core libraries for Java
中文介绍 Guava 是 Google 开源的一套 Java 核心库集合,旨在提升 Java 开发效率和代码质量。它提供了丰富的工具类和新数据结构,涵盖了集合、缓存、并发、I/O、字符串处理等多个方面。Java 开发者可将其引入项目,以简化常用编程模式、减少样板代码,并增强应用程序的健壮性和性能。
Roff · ★ 77,064 · 🍴 17,408 · 📈 134 stars today
所有小初高、大学PDF教材。
中文介绍 ChinaTextbook 项目汇集了中国小学、初中、高中以及大学的各类教材 PDF 资源。它为学生、教师和自学者提供了一个便捷、免费的电子教材获取平台,旨在解决教材查找困难的问题。用户可以轻松下载所需课本,用于学习、备课或教学辅助,极大地便利了教育资源的获取与共享。
Python · ★ 186,008 · 🍴 46,055 · 📈 37 stars today
AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mission is to provide the tools, so that you can focus on what matters.
中文介绍 AutoGPT 是一个基于大型语言模型(LLM)的自主 AI 代理项目,旨在实现人人可用的AI。它允许用户设定高级目标,AI 能够自主规划、执行任务,甚至进行自我修正,完成复杂的工作流,如研究、代码生成或内容创作。开发者和普通用户可利用 AutoGPT 自动化复杂流程,提高生产力,尤其适用于需要多步骤推理和决策的场景。
Python · ★ 29,020 · 🍴 2,683 · 📈 237 stars today
Local-first code intelligence graph for MCP and CLI. Builds a persistent map of your codebase so AI coding tools read only what matters, with benchmarked context reductions on reviews and large-repo workflows.
中文介绍 Code Review Graph是一个本地优先的代码智能图谱工具,专为MCP(多组件项目)和CLI环境设计。它构建了一个持久化的代码库映射,旨在优化AI编码工具的上下文理解,确保AI在代码审查和处理大型仓库时仅读取关键信息。通过大幅减少AI上下文长度,提升了代码理解效率和审查质量。
Go · ★ 32,400 · 🍴 2,098 · 📈 888 stars today
DeepSeek-native AI coding agent for your terminal. Engineered around prefix-cache stability — leave it running.
中文介绍 `esengine` 推出的 `DeepSeek-Reasonix` 是一个专为终端用户设计的 DeepSeek 原生 AI 编码代理。它旨在为开发者在命令行界面提供智能编程辅助,例如代码生成、补全或问题解答。该项目特别强调了其“前缀缓存稳定性”工程优化,确保代理可以长时间运行并保持高效,减少重复计算。这使得开发者能够无缝地在终端内获取 AI 协助,从而提升编码效率和开发体验。
Shell · ★ 268,093 · 🍴 23,963 · 📈 858 stars today
An agentic skills framework & software development methodology that works.
中文介绍 obra/superpowers 提供一个结合了智能 Agent 能力框架与软件开发方法的项目,旨在有效构建和部署基于 AI Agent 的复杂系统。它定义了一套结构化的方法论,用于组织、管理和编排 Agent 的“技能”,使其能够协同完成复杂的任务。该项目解决了在 Agent 驱动型软件开发中,如何系统化地设计、实现和测试 Agent 能力的问题,帮助开发者和团队更高效地将 AI Agent 集成到实际应用中,从而加速智能系统的迭代与交付。
Rust · ★ 12,431 · 🍴 836 · 📈 1,190 stars today
Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.
中文介绍 firecrawl/pdf-inspector 是一个高性能的 Rust 库,专为 PDF 文件提供快速检查、分类及文本提取功能。它能智能区分扫描版与文本版 PDF,支持开发者基于内容类型做出智能路由决策,例如决定是否进行 OCR 识别。对于需要自动化处理海量 PDF 文档、实现高效数据提取或构建智能文档工作流的后端服务和应用程序非常有用。
@wayne_liang_ · 1.5K 粉丝 · 999.9K 阅 · 637 赞 · 279 转
For eight weeks, a clone of me ran our sales front line: 300+ prospect calls a week, 132 new paying customers, 37 enterprise opportunities worth ~$3M. It also made up a price, emailed internal notes
中文介绍 博主分享育儿假期间其AI销售代理的卓越表现。该代理8周内每周处理超300个客户电话,带来了132个新付费客户和37个价值约300万美元的企业商机,并能自动报价、发送内部邮件。帖子还提供了相关代码,展示了AI在销售自动化和营收增长方面的潜力。
@XFreeze · 251.7K 粉丝 · 778.3K 阅 · 558 赞 · 80 转
Grok Build: What It’s Actually For Most people underestimate it by an order of magnitude. Ask someone what an AI coding agent is for, and they’ll probably tell you it builds apps. That’s true and it
中文介绍 XFreeze 强调 Grok Build 有能力重塑用户使用笔记本电脑的方式,并将其定位为一个「自主员工」。这篇帖子预示将提供一份实用指南,旨在帮助用户充分利用 Grok Build 的高级功能,实现工作流程的自动化和智能化,从而提升效率,革新个人生产力工具的使用体验。
@tetsuoai · 236.6K 粉丝 · 493.9K 阅 · 851 赞 · 138 转
Grok Imagine crossed a line this week. Imagine Video 1.5 shipped last month with better motion, physics, and audio. On July 31 xAI added the piece that makes actual filmmaking possible: image and
中文介绍 博主分享了使用 Grok Imagine 从零开始制作短片的完整教程。该内容详细指导用户如何利用 Grok Imagine 的功能,一步步完成电影制作,为想要尝试 AI 视频创作的创作者提供了实践指南。
@addyosmani · 407.9K 粉丝 · 363.3K 阅 · 510 赞 · 45 转
Taste is recognizing quality and greatness in the absence of all the evidence. Judgment is committing to it in the presence of some risk. It’s the ultimate foundation of great work. When you look at a
中文介绍 博主深入探讨了「品味」与「判断力」对伟大工作的重要性,尤其是在AI时代。他指出,品味是在缺乏证据时识别优质与卓越的能力,而判断力则是在面临风险时做出承诺的勇气。文章强调了这些人类核心特质,可能暗示它们是AI无法完全取代的价值基石。
@sawyerhood · 17.1K 粉丝 · 185.1K 阅 · 519 赞 · 27 转
I'm excited to show something I've been working on recently: bb, an agentic IDE that builds itself. This started as a passion project by @_ymichael, and over time I changed from being an early user
中文介绍 博主分享了一款名为「Agentic IDE」的创新开发工具,其核心特点是能够「自我构建」。该工具旨在革新传统集成开发环境,通过智能代理技术实现代码生成与环境配置的自动化,为开发者提供了新的工作范式。
@RaoulGMI · 1.5M 粉丝 · 90.0K 阅 · 530 赞 · 72 转
Within about two years, most economic activity on Earth won't have a human anywhere in it. Think about a single trade today. Someone decides to make it, another person approves it, someone books it,
中文介绍 RaoulGMI 提出了「隐形经济」这一概念。根据其标题和有限的预览文本,这篇帖子很可能探讨了由自动化和人工智能主导的未来经济模式,其中人类的直接参与显著减少。博主旨在引发读者对 AI 如何重塑全球经济结构及其潜在影响的深度思考。
@IBuzovskyi · 3.8K 粉丝 · 76.2K 阅 · 505 赞 · 34 转
Buzz launched July 21, 2026. Block open-sourced it under Apache-2.0. Desktop builds for macOS, Windows, and Linux shipped the same day. The pitch: Slack + GitHub + AI agents in one window. Built on
中文介绍 博主提供了由 Jack Dorsey 创立的 Buzz 平台的完整设置指南,并提及 HERMES AGENT。Buzz 已于2026年7月21日开源,并发布了 macOS、Windows、Linux 桌面版。该平台旨在整合 Slack、GitHub 与 AI 代理,打造一站式协作工具。帖子分享了其全面设置步骤。
@ashpreetbedi · 20.5K 粉丝 · 73.1K 阅 · 501 赞 · 50 转
Today I'm going to show you how to recursively improve your agents. We'll build an agent that starts at 7/10, then run a recursive auto-improvement loop until every probe passes. Here's how it works:
中文介绍 博主分享如何递归地提升AI代理性能的教程。他将演示如何构建一个初始表现为7/10的代理,并通过运行一个递归式的自动改进循环,使其持续优化,直至所有测试探针 (probe) 均顺利通过。这提供了一种实用的AI代理自我优化方法。
@VibeMarketer_ · 29.9K 粉丝 · 56.6K 阅 · 501 赞 · 30 转
I'm going to show you how to automate your content ideation system using Hermes kanban, a new multi-agent feature from Nous Research. Every night, it will monitor a mix of 50+ X accounts, newsletters,
中文介绍 VibeMarketer_ 分享了如何利用 Nous Research 发布的 Hermes kanban(一个全新的多代理功能)构建一个自主内容创意系统。该系统每晚会自动监控超过 50 个 X 账号和简报等信息源,以自动化内容构思流程。博主将展示具体实现方法,帮助用户大幅提升内容生产效率和策略制定。
@YifeiChen1121 · 224 粉丝 · 51.8K 阅 · 567 赞 · 22 转
How nature and serif fonts became the default face of artificial intelligence TLDR: AI branding converged on serifs + nature photos + soft neutrals to feel "humane." It worked… until everything
中文介绍 YifeiChen1121 分析了 AI 品牌形象的一种审美趋同现象:多数 AI 产品倾向于使用衬线字体、自然风光照片和柔和中性色调,以营造「人道」的感觉。这种策略旨在让 AI 更易被接受,初期效果显著,但随着应用的广泛,这种风格已变得过于普遍,可能导致品牌失去独特性。
@yisongyue · 24.2K 粉丝 · 48.3K 阅 · 503 赞 · 37 转
A new scaling dimension is emerging Today, we scale models through better data, architectures, and compute. We scale agents through better tools, search, verification, and harnesses. Tomorrow, we will
中文介绍 博主提出了「知识飞轮」这一新兴的 AI 扩展维度。他指出,目前模型通过优化数据、架构和算力实现扩展,Agent 则通过工具、搜索和验证等手段。未来,AI 将迈向更高效的知识积累与复用模式,为大模型和 Agent 的持续进化提供新思路。
@MiniMax_AI · 107.4K 粉丝 · 42.3K 阅 · 696 赞 · 103 转
Today, we're launching MiniMax H3, a general-purpose multimodal generation model. H3 understands unified context across text, images, video, and audio, generating video with native stereo sound, up to
中文介绍 MiniMax 推出 H3 通用多模态生成模型,该模型能理解文本、图像、视频、音频的统一上下文,并能生成带有原生立体声音频的视频内容,旨在打破任务与模态之间的界限。
@AITECHio · 455.4K 粉丝 · 32.6K 阅 · 512 赞 · 110 转
ChatGPT Can Now Talk While Running Your Computer OpenAI has taken AI agents another step forward. You can now have a natural voice conversation with ChatGPT while it operates your computer in the
中文介绍 OpenAI 推出 ChatGPT 新功能,用户可与模型进行自然语音对话,同时让它操作电脑。这标志着 AI 智能体技术又向前迈进了一步,增强了人机交互的深度和广度,预示了更高级别自动化应用的可能。
@moonpay · 421.1K 粉丝 · 32.0K 阅 · 547 赞 · 62 转
MoonPay, the global financial technology company powering the movement of value across fiat and digital assets, has launched PayBox, the first payment vault built for AI that lets a person's AI agent
中文介绍 金融科技公司MoonPay推出PayBox,这是首个专为AI设计的支付保管库,旨在让用户的AI代理管理和执行支付,实现法币与数字资产的无缝价值转移,进一步推动AI在金融领域的应用。
@Hi_Mrinal · 22.2K 粉丝 · 20.2K 阅 · 528 赞 · 41 转
The best way to learn from AI is to really reverse the whole process like to use ai for deep understanding rather than just "getting the answer" revert the typical workflow, instead of asking the AI
中文介绍 博主Hi_Mrinal围绕「利用AI进行学习」这一主题展开分享。推文简要提及AI在学习过程中的应用潜力,可能涉及如何有效整合AI工具、提升学习效率或获取新知识的方法。具体内容预期会探讨AI作为辅助学习工具的各种可能性。
@PeterDiamandis · 409.5K 粉丝 · 186.0K 阅 · 7d 曝光 1.1M
Speed-Running Star Trek
中文介绍 博主分享了一个关于「Speed-Running Star Trek」的内容。由于推文预览信息极少,具体内容尚不明确,可能涉及以快速通关游戏或挑战的方式重温《星际迷航》系列。
@tetsuoai · 236.6K 粉丝 · 493.9K 阅 · 7d 曝光 493.9K
How to make a short film with Grok Imagine, start to finish
中文介绍 博主分享了使用 Grok Imagine 从零开始制作短片的完整教程。该内容详细指导用户如何利用 Grok Imagine 的功能,一步步完成电影制作,为想要尝试 AI 视频创作的创作者提供了实践指南。
@yisongyue · 24.2K 粉丝 · 48.3K 阅 · 7d 曝光 48.3K
Knowledge Flywheels
@sawyerhood · 17.1K 粉丝 · 185.1K 阅 · 7d 曝光 185.1K
An Agentic IDE that builds itself
中文介绍 博主分享了一款名为「Agentic IDE」的创新开发工具,其核心特点是能够「自我构建」。该工具旨在革新传统集成开发环境,通过智能代理技术实现代码生成与环境配置的自动化,为开发者提供了新的工作范式。
@XFreeze · 251.7K 粉丝 · 778.3K 阅 · 7d 曝光 778.3K
Grok Build will rewrite how you use your laptop -A practical guide to your own Autonomous Employee
中文介绍 XFreeze 强调 Grok Build 有能力重塑用户使用笔记本电脑的方式,并将其定位为一个「自主员工」。这篇帖子预示将提供一份实用指南,旨在帮助用户充分利用 Grok Build 的高级功能,实现工作流程的自动化和智能化,从而提升效率,革新个人生产力工具的使用体验。
@canghe · 38.0K 粉丝 · 55.0K 阅 · 7d 曝光 55.0K
几千人催我的 Codex +Obsidian 公众号创作工作流,开源了!
@Weytant_V · 730 粉丝 · 17.9K 阅 · 7d 曝光 17.9K
Creating Wuthering Waves-Style Hair Shadows
@Khazix0918 · 64.8K 粉丝 · 54.4K 阅 · 7d 曝光 54.4K
开源「活人感写作.skill」,只为帮你写出没有AI味的文字。
@YifeiChen1121 · 224 粉丝 · 51.8K 阅 · 7d 曝光 51.8K
AI slop can look tasteful
@RaoulGMI · 1.5M 粉丝 · 90.0K 阅 · 7d 曝光 90.0K
The Invisible Economy
@eternityspring · 6.0K 粉丝 · 73.6K 阅 · 7d 曝光 73.6K
无保留分享 RTX 4080 本地跑 MiniMax H3,省下API的钱买冰棍不香吗?
@VibeMarketer_ · 29.9K 粉丝 · 56.6K 阅 · 7d 曝光 56.6K
How to Build an Autonomous Content Engine With Hermes
@AdrianPunk115 · 25.2K 粉丝 · 165.8K 阅 · 7d 曝光 165.8K
Vibe Coding 视觉词典(上篇):布局、页面结构、导航与常用组件
中文介绍 AdrianPunk115 发布了「Vibe Coding 视觉词典」的上篇,旨在为开发者提供关于布局、页面结构、导航和常用组件的详尽视觉指南。这篇词典可能针对特定的 Vibe Coding 风格或框架,帮助读者系统性地理解和应用前端设计与开发中的关键视觉元素,提升界面构建效率与美观度。
👍 0
Evaluating generated videos remains challenging because existing benchmarks rely on fixed evaluation content, cover only a subset of generation and editing settings, and provide limited evidence for their scores. We introduce VideoArgus, a unified rubric-grounded framework covering five video genera
中文介绍 针对现有视频生成和编辑评估基准存在的固定内容、覆盖设置有限以及分数证据不足等挑战,研究提出了一种名为 VideoArgus 的统一框架。VideoArgus 采用基于评估标准的方法,旨在更全面、准确地评估生成和编辑视频的质量,从而克服当前评估方法的局限性。
👍 20
Long-horizon reasoning in recent LLMs demands that the model switch between distinct skills inside a reasoning chain, such as first doing a math derivation, then using the result to plan a schedule. We call such problems cross-skill long-horizon tasks: multi-step tasks whose steps require different
中文介绍 针对大型语言模型(LLM)在长程推理中需在不同技能间切换的挑战,研究引入了「技能熵」(Skill Entropy)概念。该概念用于衡量 LLM 在执行跨技能长程任务时,例如数学推导后进行计划,所需的技能多样性和切换效率。这为评估和训练 LLM 的复杂长程推理能力提供了新的基准和方法。
👍 0
Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks, despite being important for retrieval-augmented generation (RAG) in legal, energy, financial, and medical applications. We present an end-to-end adaptation of the Nemotron retrieval stack
中文介绍 针对英伟达(NVIDIA)的 Nemotron 检索模型及主流多语言检索基准缺乏现代希腊语支持的问题,研究提出了一种端到端的适应方案。该方案通过语料库挖掘、检索适应和生成基础化,使 Nemotron 模型能够处理现代希腊语在法律、能源、金融和医疗等专业领域的检索增强生成(RAG)应用,填补了语言空白。
👍 1
Gradient descent on a factored model W = UV^top is implicitly biased toward low-rank solutions, while Adam, starting from the same small initialization, is not. We trace the difference to the gauge symmetry of the loss, its invariance under (U, V) mapsto (UQ, VQ). Gradient flow's low-rank mechanism
中文介绍 研究发现,在分解模型 W = UV^T 上进行优化时,梯度下降(Gradient Descent)隐式偏向于低秩解,而 Adam 优化器从相同的初始值开始则不具备此偏向。论文将这种差异归因于损失函数的规范对称性,即在 (U, V) 映射到 (UQ, VQ) 下的不变性,深入探讨了两种优化器行为不同的原因。
👍 8
On-Policy Self-Distillation (OPSD) has become a standard post-training approach for improving visual reasoning in multimodal large language models (MLLMs). Existing methods draw privileged information from diverse input sources to guide self-distillation. Yet these designs overlook Modality Imbalanc
中文介绍 针对多模态大语言模型(MLLM)在视觉推理中,现有策略自蒸馏(OPSD)方法过度依赖文本监督而忽略视觉模态重要性的问题,研究提出「OPD-V」框架。OPD-V 通过模态平衡实现视觉策略自蒸馏,有效利用多源特权信息,旨在更充分地挖掘视觉模态潜力,从而提升 MLLM 的视觉推理能力和整体性能。
👍 5
Prompt injection poses significant security risks to LLM agents. Efficient and effective red-teaming is therefore critical, both for evaluating these risks and for collecting training data to improve defenses. Existing state-of-the-art prompt injection red-teaming methods primarily rely on reinforce
中文介绍 提示注入对大型语言模型(LLM)代理构成严重安全威胁,高效红队测试对其风险评估及防御数据收集至关重要。针对现有方法主要依赖人工或基于规则且效率低下的问题,研究提出「Agent Against Agent」代理系统。该系统能自动化执行提示注入红队测试,旨在有效识别并减轻 LLM 代理的安全漏洞,提升其鲁棒性。
👍 55
Long-horizon search agents must make multiple sequential actions (steps) to search, retrieve, verify, and integrate evidence to reach a final answer. However, existing methods for training these agents typically treat all steps within a trajectory uniformly during both supervised fine-tuning (SFT) a
中文介绍 长程搜索代理需要通过多步序列行动来搜索、检索、验证和整合证据,以得出最终答案。现有训练方法在监督学习和强化学习阶段对轨迹中的所有步骤进行统一处理,效率不高。为此,研究提出「ABSeeker」,一个通过答案回溯信用分配机制训练长程搜索代理的方法,旨在更有效地优化每个步骤,提升代理的决策能力。
👍 13
Despite the remarkable recent progress of video world models, social interaction between users and the characters within these worlds remains unsupported. To fill this gap, we present HelloWorld, a video world model that enables social interaction with in-world characters. With a single button press
中文介绍 尽管视频世界模型近期取得显著进展,但用户与模型中角色进行社交互动的功能仍缺失。为弥补这一空白,研究推出了「HelloWorld」视频世界模型。HelloWorld 旨在通过支持用户与虚拟世界中的角色进行社交互动,增强沉浸式体验和交互性,从而推动视频世界模型在虚拟环境和人机交互领域的应用发展。
👍 7
Leveraging pre-trained vision-language models (VLMs) to construct vision-language-action (VLA) models has emerged as a promising paradigm for 3D robot manipulation. However, existing 3D VLA methods remain data-hungry, exhibit limited generalization under distribution shifts, and lack explicit memory
中文介绍 针对现有利用预训练视觉-语言模型(VLM)构建的 3D 机器人操作视觉-语言-动作(VLA)模型数据需求量大、泛化能力有限及易遗忘等问题,研究提出了「BridgeVLA++」框架。BridgeVLA++ 旨在通过数据高效、增强泛化能力和记忆增强机制,显著提升 3D 机器人操作的性能和鲁棒性,克服现有方法的局限性。
👍 0
Mental health professionals have raised concerns about risks of psychological harm from interaction with large language models (LLMs), including "delusional spirals" in which concerning human and LLM behaviors reinforce each other over time. With growing public use of LLM-powered chatbots, there is
中文介绍 鉴于心理健康专业人士对大型语言模型(LLM)可能导致「妄想螺旋」等心理伤害的担忧,研究提出「DelusionEval」评估框架。该框架旨在量化和测量 AI 聊天机器人中与妄想相关的行为,以识别并减轻潜在风险。通过此评估,可促进 LLM 开发更负责任的人机交互模式,保障用户心理健康。
👍 42
Vision offers a critical axis for advancing foundation models, driving a shift towards natively unified multimodal pretraining. Despite this momentum, the design space and the fundamental mechanisms of how modalities interact during unified training remain underexplored. We provide empirical clarity
中文介绍 视觉能力是推进基础模型发展的关键,正推动原生统一多模态预训练。然而,模态在统一训练中如何交互的设计空间和基本机制仍未被充分探索。本研究深入探讨了多模态预训练的「物理学」,包括知识流、模态协同、早期统一及具体实现方案,为理解和优化多模态模型提供了系统的洞察与指导。
👍 8
Interactive video world models are essential for long-horizon planning and exploration, yet they suffer from compounding errors. Post-training methods such as reinforcement learning (RL) can improve these models, but they hit a verification bottleneck: for arbitrary action sequences, no ground-truth
中文介绍 交互式视频世界模型对长程规划和探索至关重要,但易受复合误差影响。强化学习(RL)等后训练方法虽能改进这些模型,但在任意动作序列的验证上存在瓶颈。为此,研究提出了「WorldCycle」,一种自验证强化学习框架,旨在克服现有视频世界模型在长程任务中的误差累积问题,提升其规划和决策的鲁棒性。
👍 0
Recent video models increasingly support generation, reference conditioning, and editing within a single model, yet typically expose them as separate operations over fixed inputs. Practical creation unfolds across multiple shots, requiring one model to generate from text, follow a reference, or edit
👍 5
As chart images, tabular data, and visualization code play increasingly important roles across diverse domains, cross-representation understanding across these modalities poses fundamental challenges for AI systems: the relationships across representations are inherently one-to-many, supervision is
👍 1
We present PRIMAL3, an ultra-large-scale learning-based framework for multi-agent pathfinding (MAPF) that integrates reinforcement learning, topology-aware communication, LaCAM3-guided training, and PIBT-based action refinement. PRIMAL3 targets failures at topologically critical states, where agents
👍 0
Frontier language models can resolve repository-level software issues, but each attempt is expensive, and existing routers select a model from the issue text alone. We present SuperScout, which routes after scouting the repository: a 7B searcher, SuperScout-7B, first explores the repository and prod
👍 6
The abundance of casually captured monocular videos and images on social media provides a valuable source for immersive content creation, where generating novel views from such sparse observations can greatly enhance user experiences. However, producing photorealistic and geometrically consistent vi
👍 0
Coding agents powered by large language models (LLMs) are increasingly adopted in software engineering (SWE) scenarios, capable of fixing a specific bug in large-scale codebase. However, existing SWE benchmarks typically assume that high-quality issue reports with detailed information are always ava
👍 12
Memory-augmented VLM agents act on persistent spatial knowledge, yet that knowledge silently goes stale as the environment changes. We ask what happens when an agent must reconcile a confident memory claim with a contradicting observation, and whether current models can catch the conflict before it
👍 37
Personalized LLMs with persistent memory are increasingly deployed, yet the faithfulness of their user models remains unexamined. We study over-inference (OI): the phenomenon where LLMs fabricate user attributes beyond what evidence supports. We introduce MirageBench, comprising 150 personas balance
👍 10
GUI agents must remember both useful experience from earlier tasks and unfinished progress in the current interaction. Latent memory offers a compact solution by compressing multimodal trajectories into a few continuous tokens. Existing methods, however, usually map each trajectory to one fixed memo
👍 13
This technical report presents K-EXAONE 2.0, an open-weight multilingual foundation model developed by LG AI Research as a step in our effort toward global frontier-scale foundation models. Rather than training from scratch, we upcycle K-EXAONE and expand its architecture, yielding a Mixture-of-Expe
👍 0
Diffusion transformers deliver strong image generation, but their training cost grows superlinearly with resolution. Recent work justifies training or sampling at reduced resolution on a spectral premise: at high noise, a downscaled latent preserves almost the full surviving signal. Whether a downsc
👍 45
Text-to-image (T2I) models can produce visually compelling images, yet they remain limited on open-world tasks that require complex semantic understanding, multi-step reasoning, and the integration of external world knowledge. Existing efforts introduce agent capabilities into image generation, but
👍 0
We present MERaLiON-GR, a speech gender recognition system that performs binary classification (female / male) on English and Southeast Asian (SEA) languages. The model finetunes MERaLiON-SpeechEncoder-2, a large conformer based transformer pre-trained on a broad speech corpus, and applies parameter
👍 0
Existing document understanding benchmarks have largely focused on locating page elements, yet real-world document intelligence requires models to reason jointly about region semantics, spatial relations, and visual structure. We present ADOPD 2026, a reasoning-oriented extension of ADOPD that turns
👍 17
We introduce NOLLI, a procedurally generated English-Korean puzzle benchmark designed to diagnose where Korean performance gaps arise. It comprises 15 puzzle types (25 tasks; 7,500 items), with every instance seed-regenerable, verified to have a unique solution, and scored deterministically. Rather
👍 1
Vision-Language Models (VLMs) often lose visual grounding during multi-step reasoning: as reasoning chains grow longer, later inference steps rely increasingly on language priors rather than image evidence. We identify a consistent benchmark-level signature associated with this degradation: across 2
👍 1
Collaborative music agents need internal representations rich enough to support both understanding and generation, yet flexible enough for a workflow where the human retains agency. We present a hierarchical self-supervised ``world model'' for symbolic music: a 2.55M-parameter Swin V2 encoder traine
👍 7
Leading open text-to-image models often carry complementary strengths: one may lead on preference-aligned aesthetics while another follows compositional instructions more faithfully. However, differences in their autoencoders and noise schedules make it difficult to transfer these strengths across m
Track your AI spend and connect it to business outcomes
中文介绍 Rippling 公司发布了名为「AI Spend Console」的产品,旨在帮助企业追踪其在人工智能方面的支出。该工具能将 AI 投入与具体的业务成果进行关联,从而帮助用户更好地理解和优化 AI 项目的投资回报。其核心功能是提供支出洞察和绩效评估。
Meta’s terminal agent for long-horizon coding
中文介绍 Meta公司推出了Brain2Qwerty v2项目,该技术能够直接从非侵入式脑信号中解码完整的句子。这项创新研究旨在探索人机交互的新范式,通过分析大脑活动,实现无需物理输入设备即可进行文本生成,具有潜在的广泛应用前景,如辅助沟通。
Build the AI operating system for your company
中文介绍 Cloudflare Drop是一款简化部署流程的工具,用户只需在浏览器中拖放文件夹,即可立即将其内容部署到Cloudflare平台上,实现快速上线。
Count every chew with your AirPods
中文介绍 Ododok 是一款创新产品,它利用用户的 AirPods 来实现对每次咀嚼行为的计数。通过监测咀嚼数据,该产品旨在帮助用户更好地了解自己的饮食习惯,从而可能支持健康管理或饮食行为分析。
Free, open-source AI bug-fixing agent
中文介绍 Superlog Responder 是一款免费且开源的人工智能(AI)代理,专为软件开发中的 bug 修复设计。它能够自动识别并尝试解决代码中的错误,旨在提升开发效率并降低调试成本。作为 AI 驱动的工具,它提供自动化的问题诊断和修复方案。
Turn any website into LLM-ready Markdown
中文介绍 Website to Markdown API 提供了一项服务,能够将任意网站的网页内容转换为 Markdown 格式。这项转换旨在使网站数据更容易被大型语言模型(LLM)处理和理解,从而方便 LLM 进行内容分析、生成或结构化信息提取等任务。
Stop your AI from guessing brand logos
中文介绍 Brandfetch 发布了「Brandfetch MCP」,旨在解决人工智能(AI)在识别品牌标识时的“猜测”问题。该产品提供精确的品牌视觉资产数据,确保 AI 能够准确识别和使用品牌标志,从而提高 AI 应用程序在品牌内容处理方面的准确性和一致性。
Publish sites, newsletters and social posts with AI agents
中文介绍 Aveiro 是一款利用人工智能(AI)代理自动化内容发布的产品。它能够帮助用户创建并发布网站、电子新闻简报以及社交媒体帖子。通过 AI 代理的协助,Aveiro 旨在简化内容创作和分发流程,提升用户在多平台内容管理方面的效率。
Screen recording as prompts
中文介绍 Annotate 是一款创新工具,允许用户将屏幕录制内容直接用作人工智能(AI)系统的提示(prompts)。通过这种方式,用户可以直观地展示操作流程或界面问题,AI 则能据此理解用户意图并提供更精准的反馈或执行任务,从而提升人机交互效率。
One private gateway for every AI model
中文介绍 ngrok AI Gateway 旨在为用户提供一个统一且私有的安全网关,以连接和管理各类人工智能模型及相关服务,简化开发和部署流程。
中文介绍 该YouTube视频中,Vercel公司首席执行官Guillermo Rauch讨论了AI代理技术的发展趋势,并指出未来每家公司都将开始构建自己的AI代理。他可能分享了对AI代理在企业中广泛应用的见解,以及这些技术如何改变未来的商业运作模式。
中文介绍 这则YouTube视频由Claude发布,介绍了金融科技公司Ramp的工程师如何在软件开发流程的各个环节中利用AI代理。视频可能展示了AI代理在代码编写、测试、调试等方面的应用,旨在提高工程师的工作效率和开发质量。
中文介绍 这段来自“Claude (YouTube)”的视频聚焦于人们与人工智能对话时可能产生的结果。内容可能涉及AI交互的实用性、潜在挑战或未来发展方向,旨在帮助观众理解与AI系统沟通的复杂性。具体案例和深入分析需观看视频。
中文介绍 这段由 Claude 官方发布的 YouTube 视频详细介绍了其大模型在处理代码任务时“自动模式”的工作原理。视频旨在演示 Claude 模型如何通过自动化流程,辅助用户进行代码生成、调试或优化,展示了该功能在实际编程场景中的应用方式与操作逻辑。
中文介绍 该YouTube视频的标题显示,内容主要展示了如何使用AI助手Claude来「记录一项技能」。这可能是一个教程或演示,旨在教授用户如何训练Claude执行特定任务,或展示Claude学习和掌握新能力的过程。鉴于信息有限,摘要重点关注其功能演示。
中文介绍 这则YouTube视频由Claude发布,介绍了金融科技公司Ramp的工程师如何在软件开发流程的各个环节中利用AI代理。视频可能展示了AI代理在代码编写、测试、调试等方面的应用,旨在提高工程师的工作效率和开发质量。
中文介绍 这段来自“Claude (YouTube)”的视频聚焦于人们与人工智能对话时可能产生的结果。内容可能涉及AI交互的实用性、潜在挑战或未来发展方向,旨在帮助观众理解与AI系统沟通的复杂性。具体案例和深入分析需观看视频。
中文介绍 这段由 Claude 官方发布的 YouTube 视频详细介绍了其大模型在处理代码任务时“自动模式”的工作原理。视频旨在演示 Claude 模型如何通过自动化流程,辅助用户进行代码生成、调试或优化,展示了该功能在实际编程场景中的应用方式与操作逻辑。
中文介绍 该YouTube视频的标题显示,内容主要展示了如何使用AI助手Claude来「记录一项技能」。这可能是一个教程或演示,旨在教授用户如何训练Claude执行特定任务,或展示Claude学习和掌握新能力的过程。鉴于信息有限,摘要重点关注其功能演示。
中文介绍 这段“Two Minute Papers”视频指出,一场涉及“十亿美元”级别的AI竞赛似乎遭遇了重大转折或“破裂”。视频可能将深入分析这场AI竞争中的关键事件、技术突破或市场变化,对参与者和整个AI行业产生深远影响。具体细节需观看视频了解。
中文介绍 由“Two Minute Papers”频道发布的视频标题《Another DeepSeek Moment Has Arrived》暗示,DeepSeek(很可能是一个AI模型或研究项目)取得了新的突破或发布了重要成果。该视频预计将分析和介绍DeepSeek所带来的最新技术进展。
中文介绍 英伟达(NVIDIA)的人工智能研究指出,仅模仿人类行为不足以实现某些高级AI目标。该研究可能探讨了AI在复杂任务中,需要超越简单模仿,发展更深层次的学习或决策机制。这揭示了AI发展中,对智能自主性的更高要求。
13 回复 · 程序员 节点
7 回复 · 程序员 节点
12 回复 · 程序员 节点
27 回复 · Apple 节点
18 回复 · Apple 节点
13 回复 · Apple 节点
15 回复 · Apple 节点
11 回复 · Linux 节点
31 回复 · Apple 节点
7 回复 · Apple 节点
该源今日无内容。
7 points · 1 comments
20 points · 3 comments
23 points · 0 comments
Author here.Background, for anyone who hasn't followed this fight: IBM's iron–sulfur SQD results (Sci. Adv. 2025) are one of the flagship "quantum computers are useful for chemistry now" claims, and a published critique (arXiv:2501.07231) argues the quantum samples never beat cla
69 points · 13 comments
Pokémon Emerald ported to the RP2350 microcontroller. No emulator, 60 fps HDMI output. Recompiled from ARMv4T to Cortex-M33 and the Game Boy Advance's video hardware is reimplemented in software on the second core.
49 points · 2 comments
41 points · 4 comments
https://ir.amd.com/news-events/press-releases/detail/1296/am...https://chatjimmy.ai/
201 points · 101 comments
136 points · 90 comments
55 points · 37 comments
418 points · 268 comments
82 points · 148 comments
140 points · 97 comments
181 points · 146 comments
84 points · 20 comments
Hey HN, we’re Will & Johnny from ProvenMetal (https://provenmetal.com). You send us design files or specs and we give you assembled boards domestically in days.The US produced 30% of PCBs globally in 2000, now they produce 4%. Chinese manufacturers have completely dominated this space
https://www.githubstatus.com/uptime/br0l2tvcx85d
268 points · 308 comments
248 points · 190 comments
854 points · 148 comments
https://www.bbc.com/news/articles/c36d4376nd2o, https://archive.is/YDn6S
57 points · 36 comments
95 points · 20 comments
5 points · 0 comments
103 points · 18 comments
58 points · 10 comments
14 points · 1 comments
216 points · 92 comments
What's changed Added owner wildcard entries ("owner/*") to the strictKnownMarketplaces and blockedMarketplaces managed settings for allowing or blocking all marketplace repos under a GitHub org Added a warning when workflow agents, forked skills, slash commands, or resumed background agents' request
中文介绍 Anthropic的Claude Code发布了v2.1.223版本。此更新主要增加了“owner/*”通配符条目至`strictKnownMarketplaces`和`blockedMarketplaces`管理设置,从而允许或阻止特定GitHub组织下的所有市场仓库。此外,新版本还针对工作流代理、分支技能和斜杠命令等操作添加了警告提示。
What's changed Fixed worktree-isolated sessions and their subagents being able to run destructive git commands against the main checkout; isolation now applies to file edits and Bash in every session type Fixed PreToolUse auto-allow hooks bypassing tool restrictions in background agent tasks (summar
中文介绍 Anthropic的Claude Code发布v2.1.222版本,修复了工作区隔离会话及其子代理能对主检出执行破坏性Git命令的问题,并改进文件编辑和Bash的隔离。此外,还修复了PreToolUse自动允许钩子绕过后台工具限制的漏洞。
What's changed [VSCode] Added Focus view: a chat-menu toggle that hides tool activity behind an expandable per-turn summary with a live running-tool indicator, toggled with Ctrl+Alt+F or the "Claude Code: Toggle Focus view" command Added mode: "mask" for sandbox credential files on Linux and WSL — s
What's changed Bug fixes and reliability improvements
What's changed Added Claude Opus 5 (claude-opus-5), now the default Opus model — 1M context, fast mode at $10/$50 per Mtok Added sandbox.network.strictAllowlist setting to deny non-allowlisted hosts for sandboxed commands without prompting Added DirectoryAdded hook that fires after /add-dir or the S
What's changed Changed /code-review to run as a background subagent, so review work no longer fills your conversation and keeps stacked slash commands as its review target Added screen-reader announcements of deleted text for word and line deletions (Option+Delete, Ctrl+W, Cmd+Backspace, Ctrl+U, Ctr
What's changed Added emoji shortcode autocomplete in the prompt input: type :heart: to insert ❤️, or :hea for suggestions — disable with the emojiCompletionEnabled setting Added warnings when transcript writes are failing (e.g. disk full) or when session saving is off due to an inherited environment
What's changed Added sandbox.filesystem.disabled setting to skip filesystem isolation while keeping network egress control Fixed a slowdown in long sessions where message normalization cost grew quadratically with the number of turns, causing multi-second stalls and slow resumes Fixed auto mode deny
What's changed Claude no longer runs the /verify and /code-review skills on its own; invoke them with /verify or /code-review when you want them
What's changed Fixed single-segment dir/** allow rules like Edit(src/**) auto-approving writes to nested dir/ directories anywhere in the tree instead of only /dir Fixed a permission-check bypass affecting commands run in Windows PowerShell 5.1 sessions Fixed Bash permission checks to fail closed on
Release 0.147.0-alpha.13
中文介绍 OpenAI Codex项目发布了其Rust库的0.147.0-alpha.13版本。此版本是一个例行更新,但发布的摘录中未提供具体的更新细节或功能改进信息,用户需查阅项目官方日志以获取更多技术内容。
Release 0.147.0-alpha.12
中文介绍 OpenAI Codex发布了其rust项目的v0.147.0-alpha.12版本更新。本次更新是该系列的一个alpha测试版本,但具体更新内容未在发布摘要中详细说明。
Release 0.147.0-alpha.6.5
中文介绍 OpenAI Codex宣布发布了rust项目的v0.147.0-alpha.6.5版本。作为alpha测试版,该更新的具体功能或改进细节未在本次发布信息中提供。
Release 0.147.0-alpha.11
中文介绍 OpenAI Codex近期发布了其rust项目的v0.147.0-alpha.11版本。此为一alpha测试版本更新,但官方摘要中未详细说明本次更新的具体改进或功能。
Bug Fixes Apply safer automatic-review defaults for cyber-capable models and explain permission changes in the terminal interface. (#37057) Changelog Full Changelog: rust-v0.146.0...rust-v0.146.1 #37057 [0.146] Backport safer cyber-model auto-review defaults @anp-oai
中文介绍 OpenAI Codex发布了rust-v0.146.1版本。此次更新主要修复了针对具备网络能力的模型,默认启用更安全的自动审查机制,并改进了终端界面中权限变更的解释说明。
Release 0.147.0-alpha.10
中文介绍 OpenAI Codex近期发布了rust项目的v0.147.0-alpha.10版本。本次更新是一个alpha测试版本,但发布摘要中并未包含具体的特性、修复或改进细节。
Release 0.147.0-alpha.9
中文介绍 OpenAI Codex发布了其rust项目的v0.147.0-alpha.9版本。此为该系列的alpha测试更新,但发布信息中并未提供关于本次版本更新的具体细节内容。
Release rust-v0.147.0-alpha.9
中文介绍 OpenAI Codex近期发布了名为rust-vrust-v0.147.0-alpha.9的版本更新。本次发布信息未提供具体的改进或新功能详情,仅声明为一次版本发布。
Release 0.147.0-alpha.8
中文介绍 OpenAI Codex 发布了针对 Rust 编程语言的 v0.147.0-alpha.8 版本更新。
Release 0.147.0-alpha.7
中文介绍 OpenAI Codex 发布了针对 Rust 编程语言的 v0.147.0-alpha.7 版本更新。
今日AI焦点集中在智能体(Agent)技术在软件开发和企业应用中的深化,从提供虚拟操作环境、团队编排到自我构建的IDE,AI代理正加速重塑开发范式与工作流。同时,AI巨头如Anthropic自研硬件、OpenAI推出智能音箱,预示着核心技术与硬件生态的融合,而AI音乐版权和智能体普及面临的挑战也引发行业深思。
Cloudflare推出了其「Computer」项目,旨在为AI智能体提供一个虚拟、可编程的「电脑」环境。该项目允许AI Agent在沙盒环境中执行命令行操作、浏览网页、读写文件等,使其能够像人类一样与外部系统深度交互。这一创新解决了当前智能体普遍缺乏与真实世界系统交互能力的问题,为开发者构建自动化软件开发、数据分析及系统管理等复杂任务的智能体提供了强大工具,大幅提升了AI智能体的自主性和应用广度。
LoopX是一个轻量级的循环工程状态内核,专门设计用于管理和协调长时间运行的AI智能体团队。它提供了一个与具体Agent类型无关的框架,能够处理复杂的多步任务流。LoopX的核心功能包括持久化目标管理、配额感知自动唤醒机制以及可执行的任务调度,确保智能体团队在资源受限环境下高效稳定运行。该项目有效解决了大型Agent系统在状态管理、资源调度和多Agent协作方面的挑战,特别适用于自动化软件开发和复杂问题解决等场景,是AI Agent编排领域的关键进展。
Anthropic的Claude Code发布了v2.1.223版本,此更新主要增强了对GitHub市场仓库的管理能力。新版本在`strictKnownMarketplaces`和`blockedMarketplaces`管理设置中增加了「owner/*」通配符条目,允许或阻止特定GitHub组织下的所有市场仓库。此外,新版本还针对工作流代理、分支技能和斜杠命令等操作添加了警告提示,旨在提升代码管理的安全性和效率,为开发者提供更细致的控制和更安全的开发环境。
针对现有视频生成和编辑评估基准存在的固定内容、覆盖设置有限以及分数证据不足等挑战,HuggingFace发布研究提出了一种名为VideoArgus的统一框架。VideoArgus采用基于评估标准的方法,旨在更全面、准确地评估生成和编辑视频的质量,克服了当前评估方法的局限性。该框架的推出,有望为视频AI模型的研发和优化提供更可靠、更具说服力的评估工具,推动视频生成与编辑技术向更高水平发展。
XFreeze发布推文称,Grok Build将彻底改变用户使用笔记本电脑的方式,并将其定位为用户的「自主员工」。该产品旨在提供一份实用指南,帮助用户充分利用Grok Build的高级功能,实现工作流程的自动化和智能化。通过这一创新,Grok Build有望大幅提升个人生产力,革新传统的工作体验,让AI助手真正融入日常操作,成为用户不可或缺的智能伙伴。
Sawyer Hood分享了一款名为「Agentic IDE」的创新开发工具,其核心特点是能够「自我构建」。该工具旨在革新传统集成开发环境(IDE),通过智能代理技术实现代码生成与环境配置的自动化,为开发者提供了全新的工作范式。Agentic IDE的出现,预示着未来开发工具将更加智能化、自动化,能够根据开发需求自主适应和演进,大幅提升开发效率和体验。
Rippling公司发布了名为「AI Spend Console」的产品,旨在帮助企业精确追踪和管理在人工智能方面的各项支出。该工具的核心功能是将AI投入与具体的业务成果进行关联,从而帮助用户更好地理解和优化AI项目的投资回报率。通过提供详细的支出洞察和绩效评估,AI Spend Console使得企业能够更明智地分配AI资源,确保AI投资与战略目标保持一致,提升决策效率。
ngrok AI Gateway旨在为用户提供一个统一且私有的安全网关,以连接和管理各类人工智能模型及相关服务。这款产品简化了AI应用的开发和部署流程,为开发者提供了一个集中化的控制点,确保AI模型的安全访问和高效运行。通过ngrok AI Gateway,企业和开发者可以更便捷地集成和管理不同的AI服务,同时保障数据传输的安全性,是构建可靠AI基础设施的重要工具。
Vercel公司首席执行官Guillermo Rauch在一则YouTube视频中指出,AI代理技术正迅速发展,未来每家公司都将开始构建自己的AI代理。他分享了对AI代理在企业中广泛应用的深刻见解,并预测这些技术将深刻改变未来的商业运作模式。这一观点强调了AI代理在提升企业效率、自动化工作流程和创新服务方面的巨大潜力,预示着AI代理将从前沿技术走向企业基础设施的普遍配置。
Two Minute Papers发布视频指出,一场涉及「十亿美元」级别的AI竞赛似乎遭遇了重大转折或「破裂」。该视频深入分析了这场AI竞争中的关键事件、技术突破或市场变化,暗示这些因素将对参与者和整个AI行业产生深远影响。这一消息表明,AI领域的高额投入和激烈竞争正在经历关键时刻,可能导致新的市场领导者出现,或促使行业发展方向的调整。
AI公司Anthropic证实,正计划组建内部芯片团队,以设计自家硬件来支持其大模型Claude的运行。此举表明,Anthropic正与OpenAI等巨头一同,积极努力扩大其AI基础设施规模,并减少对外部GPU供应商(尤其是英伟达)的依赖。自研芯片战略旨在优化模型的运行效率、降低成本,并在激烈的AI竞争中获得更强的技术自主权和性能优势,进一步推动AI硬件生态的多元化发展。
据彭博社记者Mark Gurman报道,OpenAI正与前苹果首席设计师Jony Ive合作开发一款创新的人工智能设备。这款设备被描述为形似甜甜圈、大小与冰球相仿的智能音箱,特点是无屏幕、由电池供电,预计将很快发布。这一合作凸显了OpenAI进军硬件领域的雄心,旨在将AI技术与卓越的工业设计相结合,为消费者带来全新的交互体验,进一步拓展AI在智能家居产品中的应用边界。
博主详细分享了如何利用Grok Imagine从零开始制作短片的完整教程。该内容提供了实践指南,详细指导用户如何一步步利用Grok Imagine的功能,完成电影制作的各个环节。对于渴望尝试AI视频创作的创作者来说,这份教程极具参考价值,能够帮助他们高效掌握AI工具进行内容创作,开启全新的影像叙事方式,降低专业视频制作的门槛。
Claude发布的一则YouTube视频详细介绍了金融科技公司Ramp的工程师,如何在软件开发流程的各个环节中巧妙利用AI代理。视频可能展示了AI代理在代码编写、测试、调试、需求分析等方面的具体应用,旨在提高工程师的工作效率和开发质量。这为其他企业提供了AI代理在实际软件工程中应用的最佳实践,揭示了AI如何成为开发团队不可或缺的智能辅助工具。
这段来自Claude的YouTube视频深入探讨了人们与人工智能对话时可能产生的结果。视频内容可能涵盖了AI交互的实用性、面临的潜在挑战以及未来发展方向,旨在帮助观众全面理解与AI系统沟通的复杂性。通过案例分析和深入讨论,视频提供了对人机对话这一新兴领域的多维度视角,促使人们思考AI在日常生活和工作中扮演的角色及影响。
今天 AI 产品发布的核心脉络聚焦于 AI Agent 生态系统的深度拓展与实战应用。一方面,大量开源项目致力于提供 Agent 的底层能力、框架和编排工具,如虚拟环境、记忆管理和多 Agent 协作内核,显著降低了 Agent 开发门槛;另一方面,AI 在日常生产力领域的落地也日益成熟,涌现出将屏幕录制转化为 AI 提示,以及自动化内容发布的创新产品。
AutoGPT 是一个基于大型语言模型(LLM)的自主 AI 代理项目,旨在实现人人可用的AI。它允许用户设定高级目标,AI 能够自主规划、执行任务,甚至进行自我修正,完成复杂的工作流,如研究、代码生成或内容创作。开发者和普通用户可利用 AutoGPT 自动化复杂流程,提高生产力,尤其适用于需要多步骤推理和决策的场景。
Cloudflare Computer 项目旨在为 AI 智能体提供一个虚拟的、可编程的「电脑」环境。它允许 AI Agent 像人类一样,在沙盒化的环境中执行命令行操作、浏览网页、读写文件等,从而实现更复杂、更具自主性的任务。该项目解决了当前 Agent 普遍缺乏与外部系统深度交互能力的问题,使其能够更好地模拟真实世界中的操作。开发者可利用此工具构建能够自动化软件开发、数据分析、系统管理等多种复杂场景的智能体。
TencentDB Agent Memory 为 AI Agents 提供本地化的长效记忆解决方案。它采用四层渐进式管道设计,旨在实现无需外部 API 依赖的完全本地化记忆存储与检索,解决了 AI Agent 在需要长期记忆和上下文感知时对外部服务的依赖问题。该项目通过内建机制管理记忆,增强了数据隐私性和系统性能。适用于需要为 AI Agent 构建稳定、独立且具备丰富记忆能力的开发者,例如开发智能客服、个人助理或具备学习能力的自动化系统。
LoopX 是一个轻量级的循环工程状态内核,专为管理和协调长时间运行的 AI 智能体团队而设计。它提供了一个与具体 Agent 类型(如 Codex、Claude Code 等)无关的框架,能够处理复杂的多步任务流。LoopX 的核心功能包括持久化目标管理、配额感知自动唤醒机制以及可执行的任务调度,确保智能体团队在资源受限的环境下高效、稳定地运行。它解决了大型 Agent 系统在状态管理、资源调度和多 Agent 协作方面的挑战,特别适用于自动化软件开发、复杂问题解决等场景。
Code Review Graph是一个本地优先的代码智能图谱工具,专为MCP(多组件项目)和CLI环境设计。它构建了一个持久化的代码库映射,旨在优化AI编码工具的上下文理解,确保AI在代码审查和处理大型仓库时仅读取关键信息。通过大幅减少AI上下文长度,提升了代码理解效率和审查质量。
`esengine` 推出的 `DeepSeek-Reasonix` 是一个专为终端用户设计的 DeepSeek 原生 AI 编码代理。它旨在为开发者在命令行界面提供智能编程辅助,例如代码生成、补全或问题解答。该项目特别强调了其「前缀缓存稳定性」工程优化,确保代理可以长时间运行并保持高效,减少重复计算。这使得开发者能够无缝地在终端内获取 AI 协助,从而提升编码效率和开发体验。
obra/superpowers 提供一个结合了智能 Agent 能力框架与软件开发方法的项目,旨在有效构建和部署基于 AI Agent 的复杂系统。它定义了一套结构化的方法论,用于组织、管理和编排 Agent 的「技能」,使其能够协同完成复杂的任务。该项目解决了在 Agent 驱动型软件开发中,如何系统化地设计、实现和测试 Agent 能力的问题,帮助开发者和团队更高效地将 AI Agent 集成到实际应用中,从而加速智能系统的迭代与交付。
firecrawl/pdf-inspector 是一个高性能的 Rust 库,专为 PDF 文件提供快速检查、分类及文本提取功能。它能智能区分扫描版与文本版 PDF,支持开发者基于内容类型做出智能路由决策,例如决定是否进行 OCR 识别。对于需要自动化处理海量 PDF 文档、实现高效数据提取或构建智能文档工作流的后端服务和应用程序非常有用。
Website to Markdown API 提供了一项服务,能够将任意网站的网页内容转换为 Markdown 格式。这项转换旨在使网站数据更容易被大型语言模型(LLM)处理和理解,从而方便 LLM 进行内容分析、生成或结构化信息提取等任务。
Superlog Responder 是一款免费且开源的人工智能(AI)代理,专为软件开发中的 bug 修复设计。它能够自动识别并尝试解决代码中的错误,旨在提升开发效率并降低调试成本。作为 AI 驱动的工具,它提供自动化的问题诊断和修复方案。
ngrok AI Gateway 旨在为用户提供一个统一且私有的安全网关,以连接和管理各类人工智能模型及相关服务,简化开发和部署流程。
Annotate 是一款创新工具,允许用户将屏幕录制内容直接用作人工智能(AI)系统的提示(prompts)。通过这种方式,用户可以直观地展示操作流程或界面问题,AI 则能据此理解用户意图并提供更精准的反馈或执行任务,从而提升人机交互效率。
Aveiro 是一款利用人工智能(AI)代理自动化内容发布的产品。它能够帮助用户创建并发布网站、电子新闻简报以及社交媒体帖子。通过 AI 代理的协助,Aveiro 旨在简化内容创作和分发流程,提升用户在多平台内容管理方面的效率。