AI 情报文章归档
浏览 AI圈报 已保存的 5665 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5665
正式分类6
精选内容3361
全部文章
第 116 / 142 页 · 每页 40 条
产品发布 / 更新精选
Claude 工具 v2.1.141 版本更新
Claude 工具发布 v2.1.141 版本,带来多项功能新增与优化。主要更新包括:为钩子输出添加 `terminalSequence` 字段以支持无控制终端的桌面通知;新增 `CLAUDE_CODE_PLUGIN_PREFER_HTTPS` 环境变量,便于通过 HTTPS 克隆插件源码;引入 `ANTHROPIC_WORKSPACE_ID` 变量以在多工作区联盟中限定令牌范围。会话管理方面,`claude agents` 命令新增 `--cwd` 参数用于按目录筛选,并…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
教程 / 实战精选
BestBlogs早报:AI智能体工程化实战与安全架构
BestBlogs早报聚焦AI智能体的工程化落地。Anthropic官方指南详解Claude Computer Use最佳实践,包括解决点击偏移的根本原因、推荐分辨率策略及必须采用虚拟机隔离与人工确认门控的安全原则。OpenAI工程师分享了为Codex构建Windows安全沙箱的历程,其最终方案通过专属安全标识符和写受限令牌,实现了操作系统层面的强制文件系统隔离。早报同时指出,基准测试优异的RAG Agent在生产环境中可能出现高达30%的幻觉率。
信息来源:X:洪明 (@hongming731) · OpenAI / Claude
行业动态精选
Anthropic 首次在 B2B 采用率上超越 OpenAI,Ramp 支出数据显示
根据 Ramp AI 指数数据,Anthropic 在美国企业客户中的采用率达到 34.4%,首次超越 OpenAI 的 32.3%。其业务覆盖范围在一年内增长了四倍。但文章指出,三个因素可能使其领先优势迅速减弱。
信息来源:The Decoder:AI News(RSS) · OpenAI / Claude
观点 / 方法精选
智能与速度的定价博弈
不使用最智能的可用模型/设置会让我有些焦虑。 但有时如果速度真的很慢,我也不介意。 我在想,我们是否应该更关注价格/速度的权衡,而非价格/智能的权衡。
信息来源:X:Sam Altman (@sama)
模型发布 / 更新精选
Krea 2发布访问码,限量体验
Krea 2 访问码发放! K2-PRFUF8 / K2-NRWW9E / K2-CAP48S - 每个码可使用50次。 访问链接如下 👇 【引用 @krea_ai】:this is Krea 2. our first foundation model, built completely from scratch for aesthetic diversity and stylistic control. learn more and get early access 👇
信息来源:X:Krea AI (@krea_ai)
产品发布 / 更新精选
Claude付费计划将提供月度编程使用额度
自6月15日起,付费Claude计划可申领专用的月度编程使用额度。 该额度涵盖以下用途: - Claude Agent SDK - claude -p - Claude Code GitHub Actions - 基于Agent SDK构建的第三方应用
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
人形机器人已能自主完成8小时轮班
"如果AI抢了你的白领工作,那就转行做蓝领吧。" 🤦♂️ 与此同时,蓝领工作: 【引用 @adcock_brett】:观看一组人形机器人以人类绩效水平完成完整的8小时轮班。这是完全自主运行的Helix-02 https://x.com/i/broadcasts/1dxYljYVREYJX
信息来源:X:Kim (@kimmonismus)
观点 / 方法精选
加速设备端AI:Arm与Google AI Edge的优化实践
Arm第二代可扩展矩阵扩展(SME2)与Google AI Edge软件栈集成,将CPU转变为强大的矩阵计算加速器,从而实现高性能的设备端生成式AI。本文以Stability AI的"stable-audio-open-small"模型为例,阐述了利用LiteRT、XNNPACK和KleidiAI构建的"转换、优化、部署"自动化硬件加速流程。该方案在基于Arm架构的移动设备和笔记本电脑上,成功实现了音频生成速度提升2倍以上、内存使用减少4倍的显著效果,同时确保了高音频质量。…
信息来源:Google Developers Blog(RSS)
观点 / 方法精选
创始人手册:构建AI原生初创公司
Anthropic公司发布了一份面向AI原生初创企业的实用指南,旨在重塑2026年创业生命周期的构思、最小可行产品、发布和规模化四个核心阶段。该手册为每个阶段提供了具体目标、退出标准、常见失败模式及AI驱动练习,涵盖如何利用Claude进行问题验证与客户发现、避免AI生成代码的技术债务、区分真实产品市场契合度与早期炒作,并引入智能工作流替代创始人手动操作。指南还整合了多家初创企业的实践案例,为从零开始围绕AI构建公司的创始人提供架构、范围与安全方面的最佳实践。
信息来源:Claude:Blog(网页) · Claude
行业动态精选
普华永道全球部署Claude,助力客户构建技术、执行交易并重塑企业职能
普华永道与Anthropic宣布扩大战略联盟,将在全球数十万员工中部署Claude AI工具。双方将联合建立卓越中心,并培训认证3万名专业人员。合作聚焦三大高杠杆领域:智能体技术构建、AI原生交易执行以及企业职能重塑。普华永道已率先成立基于Claude的财务业务组。实际应用显示,Claude在保险承保、网络安全等多个领域能将交付时间缩短最高达70%,例如将保险承保周期从十周压缩至十天。
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
2028年全球AI领导地位的两种情景
报告展望2028年中美AI竞争的两种前景。若美国及盟友维持并扩大在关键计算芯片上的优势,通过加强出口管制、遏制技术窃取并加速AI应用,民主国家可确立12-24个月的技术领先,主导AI规则制定。反之,若政策松动,中国可能借助人才优势、利用管制漏洞迅速逼近甚至反超,使威权政权获得大规模自动化压制能力。当前民主国家在计算领域优势显著,但窗口期有限,需立即行动锁定胜局。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
产品发布 / 更新精选
Genkit 推出中间件系统:增强智能体AI应用的可控性与可靠性
Google开源框架Genkit近日推出其核心中间件系统,旨在提升智能体AI应用的可靠性与可控性。该系统允许开发者在生成调用、模型及工具层进行拦截,以注入自定义行为,如重试机制、模型回退以及人工介入的工具审批流程。通过创建并堆叠自定义中间件,开发者能够实现对模型输出的确定性控制。所有中间件的执行流程均可通过专用的开发者界面进行实时查看与调试,有效支持使用TypeScript、Go、Dart和Python构建生产就绪的智能体应用。
信息来源:Google Developers Blog(RSS)
行业动态精选
Runway正式进军日本市场,在东京设立总部并投入4000万美元
生成式AI公司Runway宣布在日本东京设立总部,正式进军日本市场,并计划投入4000万美元初始资金拓展业务。日本已成为Runway增长最快的市场之一,是其全球企业及自助客户的第三大市场。过去一年,日本企业客户数量增长300%,贡献了Runway亚洲总销售额的三分之一。软银、雅马哈等企业已在营销与创意流程中使用其服务。公司此次扩张旨在贴近日本领先的创意、机器人及制造行业客户,并已开始招募日本市场负责人以组建本地团队。
信息来源:Runway:News(网页)
产品发布 / 更新精选
Google Cloud 用代理模型加速数据库 AI 函数
Google Cloud 在 SIGMOD 发表论文,提出用代理模型(proxy model)加速 BigQuery 和 AlloyDB 中的 AI 函数。代理模型是面向特定查询和数据微调的轻量级模型,在 10 个基准测试中 F1 分数达到 LLM 的 90%-116%。该优化已默认集成在 BigQuery 和 AlloyDB 的优化模式下。
信息来源:Google Cloud:Databases(RSS)
教程 / 实战精选
在大型代码库中高效运用Claude Code:最佳实践与入门指南
Claude Code已成功部署于数百万行的单体仓库、遗留系统及分布式架构中。其核心在于围绕模型构建的"工具套件",而非仅依赖模型本身。该套件包含五个关键扩展点:提供代码库概览的CLAUDE.md文件、实现持续改进的钩子、按需加载专业知识的技能、插件以及MCP服务器。它采用智能体搜索模式,直接在开发者本地实时代码库上操作,无需构建和维护集中式索引,从而避免了传统RAG系统在活跃大型代码库中索引过时的问题。团队对代码库设置的投入程度直接决定了其导航效果。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
为智能体配置开发环境
Cursor发布新工具,用于配置云端智能体开发环境。核心更新包括:支持多仓库环境,使智能体可跨代码库协同工作;提供基于Dockerfile的代码化配置,支持构建密钥并优化缓存,命中缓存后构建速度提升70%;增强由智能体主导的环境设置流程,提供验证与故障回退机制。同时新增环境治理与安全功能,如版本历史、审计日志,以及可在环境级别独立管控的网络出口和密钥权限。这些改进旨在帮助团队在受控环境中更高效地运行能端到端处理任务的并行智能体集群。
信息来源:Cursor Blog · Cursor
观点 / 方法精选
在VS Code中集成多款AI模型开发
通过@continuedev在VS Code中直接运行DeepSeek V4、GLM-5.1、Kimi K2.6等多款模型@SiliconFlowAI 支持标签自动补全、AI对话编辑和智能体功能 以下是3步设置指南 🧵⬇️
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI) · DeepSeek / GLM / Kimi
模型发布 / 更新精选
SenseNova-U1 技术报告深度发布:前沿原生多模态模型构建全指南
SenseNova-U1 技术报告详尽披露了构建前沿原生多模态模型的方法,核心包括原生多模态统一建模、无损视觉接口、联合自回归与像素空间流匹配训练、以及原生混合专家骨干网络。报告提供了六阶段训练方案、强化学习后训练与蒸馏的完整实践指南。其开源版本 SenseNova-U1-A3B-MoT 基于混合专家架构,仅激活30亿参数,实现了高效快速的性能。相关资源已全面开放,涵盖技术报告、模型权重、代码和演示平台。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
行业动态精选
消息称 Anthropic 正就以超 9000 亿美元投前估值筹集至少 300 亿美元谈判
据报道,AI公司Anthropic正就新一轮融资进行初步谈判,目标是以超过9000亿美元的投前估值筹集至少300亿美元资金。这有望成为该公司迄今最大规模的融资轮次,交易最快可能在本月底完成。此前,Anthropic在今年2月完成了300亿美元的G轮融资,投后估值为3800亿美元,并从谷歌和亚马逊获得了150亿美元的投资承诺。为应对高昂的算力成本,公司计划于今年晚些时候进行首次公开募股(IPO)。
信息来源:IT之家(RSS) · Claude
产品发布 / 更新精选
MiniMax 升级 Agent 为 Mavis,推出 Agent Teams 多智能体协作
MiniMax 将升级后的 Agent 命名为 Mavis,并上线 Agent Teams,支持桌面端多个 Agent 并行协作,以解决单 Agent 在复杂任务中易中途停止、长任务性能下降、响应慢及角色分工不清等痛点。
信息来源:公众号:MiniMax(稀宇科技)
模型发布 / 更新精选
Hy3预览版登陆GMI,开源最强模型领跑
Hy3 预览版现已登陆 @gmi_cloud。🙌
信息来源:X:腾讯混元 (@TencentHunyuan)
产品发布 / 更新精选
Codex应用内浏览器升级,提升多视口测试与标注效率
Codex应用内浏览器功能迎来多项改进,支持在不同视口尺寸下测试应用,并能控制设备工具栏、在不同断点进行点击验证。长时测试中,Codex会在关键节点截图供用户核查。为加速测试,可隐藏应用内浏览器以禁用动画,使测试速度提升1-2倍。此外,标注功能现在发送更快且消耗更少tokens。
信息来源:X:Tibo (@thsottiaux)
产品发布 / 更新精选
微软推出多模型AI安全系统,集成超百智能体高效发现漏洞
微软推出新型多模型智能体安全系统,整合了超过100个基于前沿和定制模型的专用智能体,用于发现可利用的安全漏洞。该系统在CyberGym基准测试中取得了顶级性能。在最近的Patch Tuesday之前,该系统已帮助发现并修复了16个漏洞。微软宣布客户现可申请加入该系统的私有预览测试。
信息来源:X:Satya Nadella (@satyanadella)
产品发布 / 更新精选
Claude Code新增/goal功能确保任务完成
如何让Claude持续工作直至任务完成?Claude Code通过几种方式提供帮助,包括我们最近推出的功能:/goal。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
论文研究精选
AgentLens:揭示软件工程智能体评估中的"幸运通过"问题
当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于"幸运通过",表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
检索廉价,代码为王:基于可执行程序的多跳推理检索增强生成
针对多跳检索增强生成(RAG)中推理过程隐式、检索漂移及错误难以自查的问题,研究团队提出PyRAG框架,将多跳推理任务重构为程序合成与执行过程。该框架将推理步骤编写为可执行的Python程序,通过显式调用检索与问答工具实现多步计算,使中间状态变量化、反馈确定化,并生成完整可检查的推理轨迹。该方法无需额外训练即可支持基于编译器的自我修复与执行驱动的自适应检索。在PopQA、HotpotQA等五个问答基准测试中,PyRAG在无需训练和强化学习训练两种设定下均显著优于基线模型,尤…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
The 6 Messages That Actually Matter
知识工作者平均每天收到121封邮件,传统收件箱处理模式难以为继。未来邮件处理将转向高度个性化与自动化:用户能用自然语言定义处理规则,实现收据自动转发、销售线索自动录入CRM等流程。所有历史邮件将构成个人上下文层,为AI处理新邮件提供背景信息,敏感信息则由设备端模型进行私密处理。最终,收件箱本身将消失,真正重要的信息可能浓缩至仅6条。
信息来源:Tomer Tunguz 博客(VC 分析)
论文研究精选
通过简单统一的扩展实现奥赛金牌级推理
本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
持续更新导致LLM智能体记忆效用衰退
研究发现,当前由大语言模型驱动的智能体记忆系统在持续整合更新记忆时,会产生错误记忆,导致性能不升反降。即使基于完全正确的经验进行整合,GPT-4在部分问题上仍有54%的失败率,而这些问题是其无记忆时曾成功解决的。性能衰退源于整合步骤本身,而非原始经验。在受控测试中,默认保留原始经历片段的智能体,其准确率是强制整合版本的两倍;完全禁用整合、仅进行片段管理,能达到与自动管理相当的性能。因此,稳健的智能体记忆系统应将原始经历片段视为首要证据,并明确控制整合的触发条件,而非在每次交…
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Hugging Face
行业动态精选
OpenAI 回应 TanStack npm 供应链攻击并加强安全措施
OpenAI 针对 TanStack "Mini Shai-Hulud" npm 供应链攻击事件作出响应。攻击者通过维护者账户发布了恶意伪造包。OpenAI 确认内部系统未受影响,但为防范风险,已撤销并重签所有相关代码签名证书,并要求 macOS 用户在 2026 年 6 月 12 日前更新应用。公司同时加强了第三方依赖审查和自动化安全监控,以提升软件供应链安全防御。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
论文研究精选
EVA-Bench:端到端语音智能体评估新框架
EVA-Bench是一个端到端语音智能体评估框架,解决了模拟真实对话与测量全范围语音故障两大挑战。它通过动态多轮机器对话和自动验证进行仿真,并提出了衡量任务完成度、音频保真度的EVA-A指标,以及评估对话体验的EVA-X指标。框架包含三个领域的213个场景及鲁棒性测试集,采用区分峰值与可靠能力的测量方法。在12个系统的测试中发现,无系统能在两项核心指标上同时超过0.5,峰值与可靠性能差距显著,且口音与噪声扰动暴露出明显的鲁棒性缺陷。该框架已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
谷歌AI重塑智能鼠标指针交互
团队正在用AI重新构想鼠标指针,成果非常酷!在@GoogleAIStudio尝试原型版本,体验相当神奇。 【引用 @GoogleDeepMind】:我们正用AI重新构想这个存在50年的界面--鼠标指针。🖱️ 这些实验演示展示了人们如何通过动作、语音和自然简写,在屏幕上直观操控Gemini完成任务🧵
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
产品发布 / 更新精选
v2.1.140 版本更新
本次更新包含多项错误修复与体验优化。核心改进包括:增强了Agent工具的`subagent_type`匹配逻辑,现对大小写和分隔符不敏感;修复了`/goal`命令在特定钩子设置下无响应的问题,现会显示明确提示;解决了Windows系统上因缺失可执行文件导致的周期性事件循环停滞。此外,还修正了后台服务启动、远程设置认证重试、托管市场更新策略持久化、`/loop`命令调度冗余以及`Read`工具参数验证等多个问题。插件系统现会对因配置冲突而被静默忽略的默认组件文件夹发出警告。
信息来源:Claude Code:GitHub Releases(RSS) · Claude
产品发布 / 更新精选
Codex实现跨应用无感多任务处理
计算机使用让Codex能在你的应用间工作而不占用你的Mac。 @AriX与@romainhuet探讨当代理程序能点击、输入并在后台持续工作时将带来哪些改变。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
模型发布 / 更新精选
Claude Opus 4.7快速模式开放研究预览
Claude Opus 4.7的快速模式现已在API和Claude Code中开放研究预览。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
终于有人敢说真话了,AI根本不会让你失业。
吴恩达驳斥"AI导致大规模失业"的恐慌叙事,指出其流行源于三方利益驱动:前沿AI实验室借渲染技术颠覆性拉高估值;AI公司以替代高薪员工为由抬高定价;企业将低息时代的过度招聘裁员归咎于AI提效。现实数据反驳了失业论,受AI冲击显著的软件工程行业招聘依然强劲,美国失业率保持健康水平。历史表明技术会改变而非消灭工作,AI正在创造大量新岗位。未来挑战在于技能转型,而非工作短缺。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
产品发布 / 更新精选
谷歌推出Gemini智能,赋能高端安卓设备
今天在@Android Show(I/O特别版)上,我们发布了Gemini智能--将Gemini的最佳功能引入我们最先进的设备。 跨应用和Chrome自动化多步骤任务,一键填写表单,通过Rambler将口语想法转化为精炼文本,构建自定义小部件及更多功能。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
产品发布 / 更新精选
GitHub Copilot 个人计划:在 Pro 和 Pro+ 中引入弹性配额,以及新的 Max 计划
GitHub 宣布从6月1日起更新 Copilot 个人计划阵容,基于用户反馈进行调整。主要变化包括在现有 Pro 和 Pro+ 计划中引入弹性配额机制,允许用户更灵活地分配使用量;同时新增 Max 计划,扩展高级选项。此次更新旨在提升计划的可定制性,为开发者提供更个性化的编程辅助服务,优化整体使用体验。
信息来源:GitHub Blog
产品发布 / 更新精选
Symphony为每个任务启动运行Codex智能体
Symphony:每个开放任务都有一个正在运行的Codex智能体
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
模型发布 / 更新精选
Perceptron Mk1视觉语言模型上线OpenRouter
Perceptron Mk1已在OpenRouter上线,由@perceptroninc开发。 前沿视频与具身推理的视觉语言模型。以动态帧率(最高2 FPS)分析视频,具备32k多模态上下文,采用混合推理和结构化空间基元(点、框、多边形、片段)作为首要输出。
信息来源:X:OpenRouter (@OpenRouter)