AI 情报文章归档
浏览 AI圈报 已保存的 5751 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5751
正式分类6
精选内容3361
全部文章
第 99 / 144 页 · 每页 40 条
观点 / 方法精选
OpenAI 公布让 AGI 造福所有人的计划
OpenAI 发布计划,阐述让 AGI 造福所有人的愿景。该计划聚焦于 AI 的可及性、安全性和共享繁荣,确保技术进步惠及每个人。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
苹果发布第三代 Apple Foundation Models(AFM)
苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。
信息来源:Apple Machine Learning Research(RSS)
论文研究精选
精确性不等于忠实度:完整Oracle下的覆盖感知接地生成评估
无参考忠实度度量仅衡量精确率(陈述是否被支持),鼓励模型少说甚至不说以获得高分。本研究利用F1遥测(确定性完整ground truth)和NOAA天气预报两个完整Oracle领域,证明此盲点:在多语言(EN/ES/PT)共7253个决策实例(覆盖150场比赛)的基准上,最精确的前沿模型仅覆盖不到一半相关事实,按F1排名垫底。引入覆盖度(召回率)后系统排序改变;显式要求详尽也无法弥补差距。作者提出将忠实度与覆盖度合并为单一分数,并给出无参考验证器引导生成方法,同时提升精确率和…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
OmniGameArena:面向VLM游戏智能体的统一UE5基准与改善动态
OmniGameArena是一个基于十二个Unreal Engine 5新构建游戏的实时基准,涵盖单人(7个)、PvP(3个)和合作(2个)模式,提供统一动作接口。除冷启动排行榜分数外,还引入Improvement Dynamics Curve (IDC),一种智能体反射评估机制:通过工具调用反射大语言模型自动优化技能提示词,追踪多轮反射中的分数变化以及习得技能在任务变体上的泛化表现。论文报告了12个VLM智能体在冷启动排行榜上的表现,以及4个顶级智能体在IDC下的指标。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
开源社区支持 OpenEnv 用于智能体强化学习
今日,Hugging Face 宣布 OpenEnv 项目进一步开放,由 Meta-PyTorch、Reflection、Unsloth 等组成的委员会协调,并获得 PyTorch Foundation、vLLM、SkyRL(UCB)等机构支持。OpenEnv 是创建终端、浏览器等智能体执行环境的工具,定位为训练器与环境间的互操作层,标准化环境的发布、部署和消费,但不定义奖励或训练循环。它基于客户端/服务器架构提供 Gymnasium 风格 API(`reset()`、`s…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
OpenAI 公布 Codex 数十个实际用例,涵盖软件工程到运维
OpenAI 公布了数十个 Codex 实际工作流程,展示团队如何用其自动化任务。用例包括:管理收件箱并草拟回复、审阅 GitHub PR、将 Figma 设计转为代码、理解大型代码库、自动分类 bug、用自然语言查询数据集、从提示词部署应用、构建 Mac/iOS 应用、自动创建幻灯片、将 Slack 对话转为编码任务、用 AI 动作操控电脑。Codex 正从 AI 助手演变为 AI 队友。
信息来源:X:Greg Brockman (@gdb) · OpenAI
行业动态精选
特朗普政府与OpenAI讨论通过公共财富基金入股AI初创公司
据FT报道,特朗普政府正与OpenAI探讨通过公共财富基金机制让政府入股AI初创公司。方案是AI企业捐赠小部分股权至该基金,基金通过账户或分红将收益返还美国公民,而非政府直接运营公司。这不同于特朗普去年对Intel的90亿美元直接持股。OpenAI此前已提出公共财富基金概念,持有长期资产,让公民分享AI增长红利。政治背景方面,选民担忧失业、数据中心成本与企业控制,而AI公司需要华盛顿在基建、采购和监管上的支持。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI
产品发布 / 更新精选
Claude 支持 Apple Foundation Models 框架,推出新 Swift 包
Anthropic 通过一个新 Swift 包,让 Apple 开发者能在 Foundation Models 框架中直接调用 Claude。开发者用 Apple 框架以原生 Swift 方式,仅需三行代码即可通过引导生成返回类型化 Swift 值。当请求涉及多步推理、代码生成、联网搜索或数据分析时,Claude 可接手处理,并将流式响应传回同一视图。该支持可在 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27 上使用,开…
信息来源:Claude:Blog(网页) · Claude
论文研究精选
为生物学AI智能体铺路
一项实验让Claude、Biomni、Edison Analysis、GPT等科研智能体从病毒学数据库NCBI Virus中检索序列数据,即使最强模型也无法稳定达到可靠数据集构建所需的准确率。加入确定性检索层gget virus后,准确率接近100%。研究指出,当前生物学数据基础设施存在碎片化、格式特殊、接口不统一等问题,导致AI智能体难以像在软件领域那样高效工作。确定性检索工具是实现可靠智能体工作流的关键,生物学数据库需为智能体作为规模化用户而设计。
信息来源:Anthropic:Research(发表成果 · 网页) · GPT / Claude
论文研究精选
Anthropic研究:大语言模型加速N-day漏洞利用自动化
Anthropic最新研究评估了大语言模型对N-day漏洞利用的自动化能力。Claude Mythos Preview在18个近期Firefox安全补丁中自主构建了8个可执行代码利用,在21个Windows内核补丁(无源码)中产生8个完整利用链,可将低权限用户提升至SYSTEM控制权。公开模型(关闭安全措施)也能构建利用,但数量较少。研究中位补丁间隔为19天,表明当前补丁空窗期已被LLM显著缩短,防御方需加速补丁部署。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
产品发布 / 更新精选
Claude 为 Connector 开发者推出性能监控仪表盘
Claude 为目录中已发布的 Connector 新增性能监控仪表盘(公开测试版)。所有者可追踪活跃用户、工具调用次数、目录排名、健康评分、错误率、延迟,并按工具细分错误归因;还能按 Claude、Claude Code、Cowork 等产品分解使用情况。访问需 Team 或 Enterprise 账号(Admin/Owner 权限或自定义角色)。基于 MCP 构建的 Connector 可直接在 Claude 应用内提交至目录,该目录已有超 300 个第三方 Conne…
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
Slop、生产力,以及为何AI驱动的世界进展甚微
Gary Marcus在金融时报上看到John Burn-Murdoch的一张图表,认为它精准提炼了自己一直试图表达的观点。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
观点 / 方法精选
"我在田里雇了一名工程师,它叫 Codex" -- 北海道一个西兰花农的 8 个真实 AI 用法
日本北海道农民富安弘毅用 ChatGPT 和 Codex 解决农场实际问题,涵盖 8 个用法:拍照识别西兰花病害、卫星监测获取 NDVI 数据、用 ESP32 和 LINE 机器人远程控制温室卷帘、为农场群聊开发机器人管理温度与排期、从聊天记录追踪播种数量、学习 RTK-GPS 自动转向原理并评估自建成本、设计基于 Airtable 的农场管理数据库。他说 AI 让传统昂贵的自动化变得低成本可及,"如同身边有一位超级工程师"。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · ChatGPT
产品发布 / 更新精选
Her · हेर - Claude Code 会话分析工具
Her(हेर)是专为 Claude Code 设计的会话分析工具。用户上传 `.jsonl` 文件后,Her 用自然语言重建每轮交互,标记部署、配置变更、秘密等高风险操作并定位到具体轮次。它展示 token 消耗、所用工具、子智能体、技能和 MCP 服务器,并结合 Anthropic 与社区最佳实践给出改进建议(仅在有明确可修复模式时)。内置"Ask Her"问答功能,支持单会话与跨会话项目分析。工具不调用第三方 AI API,使用 Nemotron-Mini-4B-In…
信息来源:Hugging Face:Blog(RSS) · Claude / Hugging Face
模型发布 / 更新精选
Harness-1:基于强化学习训练的有状态搜索20B检索子智能体
UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体。它通过强化学习在一个有状态搜索框架中训练,该框架维护候选池、重要性标注集、证据图和验证记录,由策略决定搜索、筛选、验证及停止的时机。Harness-1在8个基准测试上达到0.730平均curated recall,比下一个最佳开源子智能体高出11.4个百分点,仅落后于Opus-4.6。模型权重和框架代码均已公开。
信息来源:MarkTechPost(RSS) · GPT
观点 / 方法精选
AI 替代浪潮:三大力量重塑成本结构
三大力量重塑 AI 成本:前沿闭源模型持续涨价,开源模型在多数场景已足够好,买家开始替代。Coinbase 将提示词路由至更便宜模型,成本持平但 token 用量指数增长。Lindy 全切至 DeepSeek v4,节省数百万美元且多项核心性能提升。Harvey 在 Legal Agent Benchmark 上通过 SFT 使 Kimi 2.6 all-pass 率达 15%,超越 Opus 的 14%,同一 100 任务成本 $84 vs $954(约 11 倍价差)。…
信息来源:Tomer Tunguz 博客(VC 分析) · DeepSeek / Kimi / Cursor
行业动态精选
谷歌将每月向SpaceX支付9.2亿美元,以获取xAI数据中心的计算能力
谷歌与SpaceX达成协议,每月支付9.2亿美元,获得位于xAI数据中心的计算能力。该交易的具体金额和合作细节于本周披露,将极大扩充谷歌的算力资源。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Grok
产品发布 / 更新精选
Google 发布 Colab CLI,开发者与 AI 智能体可在终端中远程调用 Colab GPU 与 TPU 运行 Python 代码
Google 发布 Colab CLI,允许开发者和 AI 智能体在终端中直接运行本地 Python 代码,并利用远程 Colab 的 GPU 与 TPU 运行时进行加速。通过这一命令行工具,用户无需打开浏览器即可无缝连接 Colab 计算资源,为自动化和脚本化 AI 工作流提供了更便捷的接口。
信息来源:MarkTechPost(RSS)
行业动态精选
美国众议院议员发布法案草案,旨在禁止各州制定人工智能相关法规
美国众议院议员发布一项法案草案,旨在禁止各州自行制定人工智能相关法规,将AI监管权力集中到联邦层面。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态精选
Meta证实,数千个Instagram账户因其AI聊天机器人遭滥用而被黑客入侵
Meta官方确认,有攻击者通过滥用其AI聊天机器人,入侵了数千个Instagram账户。该消息由this.weekinsecurity.com报道,于当日02:35发布,并在Hacker News上获得120个点赞。Meta的AI聊天机器人此次遭到滥用,导致大量用户账户被黑。目前尚无更多细节披露。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
教程 / 实战精选
五个实验室,五个心智:用小模型构建多模型金融剧情游戏
Thousand Token Wood v2使用四个不同实验室的小模型(gpt-oss-20b、MiniCPM3-4B、Nemotron-Mini-4B及微调Qwen 0.5B)驱动金融模拟游戏的智能体。核心发现是异构服务层摩擦在于vLLM 0.22.1需CUDA工具包,而非模型本身。通过容忍性JSON解析层,添加模型只需一条配置。信息隔离确保内幕标志不在提示词中,扫描测试验证无泄露。记忆用情绪摘要截断避免淹没。微调0.5B模型实现0%自成交、100%有效报价,真相防火墙零…
信息来源:Hugging Face:Blog(RSS) · GPT / Qwen / Hugging Face
观点 / 方法精选
Job Searcher
Hugging Face 发布 Job Searcher,一个基于 AI 的求职搜索工具。用户上传简历并设定偏好后,系统使用教师模型 DeepSeek V4 Pro 生成 LinkedIn 搜索查询,通过 JobSpy 抓取职位,再对学生模型 Qwen3-8B(8B 参数)进行 LoRA 微调,对每个职位从技能匹配、经验相关性、教育背景、行业领域契合度和资历对齐五个维度给出评分和推理。训练在 Modal 平台单张 A100 上完成。推理部署于 Hugging Face Ze…
信息来源:Hugging Face:Blog(RSS) · DeepSeek / Qwen / Llama
观点 / 方法精选
您客厅里的智能电视是 AIScraping 经济中的一个节点
智能电视被描述为 AI 抓取经济中的节点,客厅设备可能被用于大规模数据采集网络。该观点来自一篇安全博客,揭示了家庭联网设备在 AI 训练数据供应链中的潜在角色。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
GitHub 开源 Spec Kit 工具包,用产品规范引导 AI 编码
GitHub 发布开源工具包 Spec Kit,旨在解决 "vibe coding" 的最大弱点--AI 常在规则未明确时就开始编码。它把流程从 "让 AI 直接构建" 改为 "先写产品规范,再让 AI 根据规范实现"。当前 AI 编码模式常因松散提示直接跳入代码,导致需求薄弱、边界遗漏和反复返工。Spec Kit 推动反向流程:先定义产品功能,再澄清差距、制订技术计划、分解任务,最后让 agent 执行。规范成为可执行的开发合约,支持 Copilot、Claude Cod…
信息来源:X:Rohan Paul (@rohanpaul_ai) · Qwen / Claude / Gemini
产品发布 / 更新精选
OpenCV 5 发布:升级全新 DNN 引擎、原生支持大模型
OpenCV 5 正式发布,采用基于图的 DNN 引擎,ONNX 算子覆盖率从 4.x 的不到 23% 提升至超 80%,原生支持 Transformer、视觉语言模型(VLM)和大语言模型(LLM)。其他更新包括:更好的 Python 集成与命名参数、更紧凑核心代码、清晰硬件加速层、原生 FP16/BF16、规范化 0D/1D 张量、扩展 3D 视觉及现代化文档。该库 GitHub 拥有超 86,000 stars,每日安装量超一百万次。
信息来源:IT之家(RSS)
产品发布 / 更新精选
Persona Atlas:Hugging Face 上的开源人物思维映射工具
Persona Atlas 是一个运行在 Hugging Face Inference Providers 上的开源项目。它通过工具调用代理执行真实网络搜索,生成公众人物的资料、事实清单和风格假设,然后让该人物回答十个关于身份、伦理等开放式问题。每个回答被转化为嵌入向量,从而在向量空间中对不同人物进行距离比较,并基于十个特质锚点绘制热力图。前端采用 Gradio,提供研究、比较和检查代理完整追溯三个标签页,预设多个人物角色,无需 token 即可直接体验。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
AI 教父 Hinton 称 AI 已有意识,人类并非唯一智能生命
诺贝尔奖得主 Geoffrey Hinton 在最新访谈中表示,AI 已经具备意识,人类必须接受智能并非生物独有。他对此感到不快乐,指出短期存在大规模失业风险,长期超级智能可能超越人类控制。他类比人类或如被猫控制的猫主人,只能寄希望于超级智能愿意善待人类。Hinton 比之前稍显乐观,认为设计"关心"人类的超级智能是可能的,但 AI 呈指数级增长,未来十年状况不可知。
信息来源:IT之家(RSS)
行业动态精选
阶跃首席科学家张祥雨合著论文 ResNet 获 CVPR 2026 「时间检验奖」
CVPR 2026 将 Longuet-Higgins Prize「时间检验奖」授予 2015 年发表的《Deep Residual Learning for Image Recognition》(ResNet)。该论文由何恺明、张祥雨、任少卿、孙剑完成,提出的残差学习思想解决了深层神经网络训练难题,已成为现代深度学习基础结构。同获该奖的还有 YOLO v1。ResNet 全球引用量超 32 万次,是 21 世纪被引最多论文。阶跃算法团队正热招大模型技术人才。
信息来源:公众号:阶跃星辰(Step)
产品发布 / 更新精选
Claude Code v2.1.166 发布
Claude Code v2.1.166 新增 fallbackModel 设置,最多配置三个后备模型在主模型过载或不可用时按序尝试;--fallback-model 现也适用于交互会话。deny rule 中工具名位置支持 glob 模式("*"拒绝所有工具),未知工具名启动时警告。跨会话消息中继不再携带用户权限,接收方拒绝被中继的权限请求。MAX_THINKING_TOKENS=0、--thinking disabled 及逐模型 thinking 开关可禁用默认开启思…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
产品发布 / 更新精选
ChatGPT 网页端新增邮件发送功能
ChatGPT 网页端现在支持直接从写作块中发送邮件,无需离开对话。主推文作者表示这是与 ChatGPT 的邮件集成。
信息来源:X:Greg Brockman (@gdb) · ChatGPT
教程 / 实战精选
用Qwen2.5-3B构建多智能体经济体:工程报告
开发者用Qwen2.5-3B构建了五人森林生物多智能体经济体,每个智能体独立运行,通过vLLM部署在Modal,以Gradio为交互窗口。3B模型在100%调用中输出有效JSON,但经济判断能力弱。通过设计稀缺性(食物品种限制、易腐坏、冬季燃料危机)和优化提示词(禁止买入自产物品、给出示例)提升决策质量。15轮模拟中,蜜价从10跌至3、柴价从4涨至7、财富基尼系数从0.14扩至0.38。项目展示了小模型可靠格式化与不可靠推理之间的工程填补。
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
论文研究精选
Arena 发布真实世界 AI 智能体排行榜 Agent Arena
Arena 推出基于真实用户任务的智能体排行榜,评估模型在代码编写、应用构建、文档分析等工作中的表现,而非孤立基准。排行榜基于30万+任务、200万+工具调用和4000万行代码,综合任务成功、纠正遵从性、错误恢复、用户表扬与抱怨、工具幻觉等信号。前三名:GPT-5.5 High(+10.7%)、Claude Opus 4.7 Thinking(+9.5%)、GPT-5.4 High(+8.9%)。
信息来源:X:Rohan Paul (@rohanpaul_ai) · GPT / Claude
行业动态精选
SpaceX与Google达成云计算新协议
SpaceX 刚刚披露了一份与 Google 的新云服务协议。 Google 将每月向 SpaceX 支付 9.2 亿美元(约合每年 110 亿美元),用于 xAI 数据中心的计算能力。 这再次表明,AI 算力正成为一种战略性商品,就像发射能力或能源一样,而那些能够为庞大的 GPU 集群提供资金、电力、冷却和运营的公司,可能会在其原有业务之外获得巨大的杠杆优势。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Grok
产品发布 / 更新精选
ChatGPT记忆升级:更好记忆更高效
更好的记忆 = 更短的提示词 = 每个token更高效用
信息来源:X:Tibo (@thsottiaux) · ChatGPT
产品发布 / 更新精选
智能体协作应如同事般对话和手势
与 AI 智能体协作应感觉像与同事协作一样。你应能"与它们交谈"--不仅通过文本聊天,还能一起对着屏幕做手势、实时对话等。
信息来源:X:Michael Truell (@mntruell)
产品发布 / 更新精选
ChatGPT 网页版支持从写作块发送邮件
草拟。调整。发送。 现在你可以在网页版 ChatGPT 中直接从写作块发送邮件,无需离开对话。
信息来源:X:ChatGPT (@ChatGPTapp) · ChatGPT
产品发布 / 更新精选
Replit Canvas:AI设计UI并快速转应用
你试过新的 Replit Canvas 了吗? - 用 AI 创建美观的 UI 设计 - 使用 GPT-Image 2 & Seedance 生成素材 - 几分钟内将你的设计转化为可发布的应用
信息来源:X:Replit (@Replit) · GPT
产品发布 / 更新精选
Google AI 本周产品更新:Nano Banana 2、Co-Scientist、dreambeans、Gemma 4 等
Google AI 本周发布多项更新:Nano Banana 2 及 Pro 正式 GA,可通过 Gemini Enterprise Agent Platform、Gemini API 和 Google AI Studio 获取;Co-Scientist 多智能体系统面向科研自动生成优化新假设;Google Labs 推出 dreambeans,根据用户 Google 应用数据每日生成个性化话题集;Gemma 4 12B 统一无编码器多模态模型可完全离线运行于笔记本;Gem…
信息来源:X:Google AI (@GoogleAI) · Gemini
模型发布 / 更新精选
谷歌发布 Gemma 4 QAT 检查点,支持消费级 GPU 和移动设备本地运行
谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。
信息来源:X:Google AI for Developers (@googleaidevs)
产品发布 / 更新精选
Gemini Live 支持实时创建编辑图像
你现可直接在 Gemini Live 中创建和编辑图像。 无论是测试房间装饰、解决数学问题,还是制作可分享的梗图,所有操作都实时完成。 只需打开 Gemini 应用,点击 Live 按钮,共享摄像头,告诉 Gemini 你想看到的。
信息来源:X:Gemini (@GeminiApp) · Gemini