AI 情报文章归档
浏览 AI圈报 已保存的 5743 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5743
正式分类6
精选内容3361
全部文章
第 101 / 144 页 · 每页 40 条
教程 / 实战精选
Claude Cowork 产品指南
Anthropic 发布 Claude Cowork,一款运行在 Claude 桌面应用中的知识工作智能体。它可读写本地文件、跨 Slack 和 Google Drive 等应用协作,执行多步骤任务并生成带引用的实际交付物。核心能力包括本地文件访问、子智能体、长时间运行和定时任务。Claude Cowork 区别于对话式 AI 工具,支持用户描述目标与期望结果后自动规划执行。指南还介绍了产品矩阵(对话聊天、Claude Code 编程、Claude Cowork 跨应用知识…
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
谷歌推出基于 Gemini Enterprise Agent Platform 的 Agentic RAG 框架
Google Research 与 Google Cloud 合作推出跨语料库检索(Cross-Corpus Retrieval)框架,作为 Gemini Enterprise Agent Platform 的 Agentic RAG。该多智能体工作流将复杂企业查询分解为子任务,通过规划、重写和路由,迭代搜索多个数据源直至获得充分上下文,再生成可靠回答。与标准 RAG 相比,在事实性数据集上准确率最高提升 34%;在多个领域特定内部数据集上也实现了更好的接地与推理准确性。
信息来源:Google Research:Blog(网页) · Gemini
论文研究精选
不再遗漏任何Token:解析Miles中的Token-In-Token-Out(TITO)
Miles框架提出Token-In-Token-Out(TITO)原则,解决智能体强化学习中训练-推理不匹配:确保rollout过程token序列与训练器评估序列逐位一致。TITO将多轮轨迹视为一个连续序列(每任务一个样本),节省一个数量级计算开销并维持on-policy性。三种破坏场景:反分词-再分词不匹配、聊天模板修剪推理内容、有损模板重新渲染。Miles通过推理会话服务器、三级只追加保证、可插拔TITO分词器和序列比较器实现。典型任务(如SWE-Bench)轨迹含30…
信息来源:LMSYS:Blog(Chatbot Arena 团队)
产品发布 / 更新精选
Google Colab CLI 发布
Google 推出 Colab 命令行界面(CLI),允许开发者和 AI 智能体将本地终端连接到远程 Colab 运行时,实现无摩擦执行。该轻量级 CLI 支持请求高性能 GPU、远程运行本地 Python 脚本,并检索工件日志或模型(如微调后的 Gemma 3 适配器)。工具可直接集成到标准终端环境,可被 Antigravity、Claude Code 等 AI 智能体调用以管理复杂机器学习流水线。
信息来源:Google Developers Blog(RSS) · Claude
论文研究精选
Anthropic:让Claude成为化学家
Anthropic与顶尖化学家合作,提升Claude在化学领域的实用性。首个白皮书测试Claude在NMR谱图分析上的表现:在20个化合物上,对比Claude Opus 4.7、Opus 4.6、Sonnet 4.6与ChemDraw、MestReNova的正向预测(从结构预测谱图)和反向结构解析(从实验谱图推断结构)能力。所有化合物选自模型训练截止日期后发布的ChemRxiv预印本,以避免选择偏差。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
模型发布 / 更新精选
Nex-N2-Pro 发布:基于 Qwen3.5 的 397B MoE 推理模型,性能达 GPT-5.5 水平
neolab 推出 Nex-N2-Pro,基于 Qwen3.5-397B-A17B,总参数 397B 的 MoE 推理模型,支持 262K 上下文与多模态(VLM),性能达到 GPT-5.5 和 Claude Opus 4.7 级别。模型可自动调节推理深度,减少 30-50% 思考 token 且无性能折损,在 Terminal Bench 2.1、GDPVal、SWE-Verified 上取得 SOTA。擅长智能体编码、深度搜索和工具使用,兼容 Claude Code、C…
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI) · GPT / Qwen / Claude
模型发布 / 更新精选
SenseNova U1 开源统一模型:原生图文生成
商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为"非常令人印象深刻"。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
产品发布 / 更新精选
Krea 2 Turbo:2秒生成高质量图像
推出 Krea 2 Turbo。 仅需2秒即可生成高质量图像;兼容风格参考、情绪板和 LoRA。 在 krea . ai 免费试用。
信息来源:X:Krea AI (@krea_ai)
产品发布 / 更新精选
Runway Aleph 2.0 精准局部编辑轻松实现
你需要的编辑,变得简单。Aleph 2.0 只更改你想要编辑的部分,保持画面的其余部分不变。在我们的新 Edit Studio 中试试。 通过下方链接开始使用。
信息来源:X:Runway (@runwayml)
行业动态精选
DeepSeek连续四周登顶Token份额榜
DeepSeek 现已连续四周在我们平台的 token 份额排行榜上位居第一: https://openrouter.ai/rankings
信息来源:X:OpenRouter (@OpenRouter) · DeepSeek
模型发布 / 更新精选
阶跃星辰 Step 3.7 Flash 在 Fireworks AI 上架
阶跃星辰的 Step 3.7 Flash 已上架 Fireworks AI。该模型为 198B 稀疏 MoE 多模态大模型(VLM),含 196B 语言骨干和 1.8B 视觉编码器,从设计之初优化推理效率,采用硬件友好架构与 MTP 辅助解码,速度达 400 tokens/s。具备原生多模态理解与行动、可靠工具使用、增强搜索能力,面向真实智能体工作负载,采用 Apache 2.0 开源许可。
信息来源:X:阶跃星辰 StepFun (@StepFun_ai)
观点 / 方法精选
SkyClaw-v1.0 深度实测:Agent专属模型,顶尖性能表现,极致价格优势
5月26日,昆仑万维发布SkyClaw-v1.0,定位面向复杂工具使用和真实世界任务执行的高性能Agent模型,输入仅0.5元/百万token、输出4元/百万。实测显示,其从零生成番茄钟和记账本应用时,能自主用Web Audio API合成音效、用SVG手绘图表,细节处理成熟。在现有代码库修改任务中,越难的任务表现越好:单点bug修复精准,能准确诊断iOS Safari滚动问题并给出克制式修复方案。但官方未报告SWE-bench成绩,表明其优势集中在从零生成与模式匹配场景,…
信息来源:公众号:昆仑万维(天工)
观点 / 方法精选
Nemotron 3.5 ASR:为你的语言、领域或口音进行微调
Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
OpenAI称AI递归自我改进迹象初现
OpenAI刚刚写道:"我们也看到了当今系统中递归自我改进(RSI)的早期迹象:AI开发本身正被AI加速。 我们预计这将加剧开发者与国家之间的竞争压力,并带来现有机构无法应对的治理挑战。 随着RSI的出现,社会将需要找到塑造AI发展轨迹的方法,确保其服务于人类利益。" 气氛变了,有事正在发生。
信息来源:X:Kim (@kimmonismus) · OpenAI
论文研究精选
EVA-Bench Data 2.0 发布:覆盖三大领域、121 个工具、213 个场景
EVA-Bench Data 2.0 将评估范围从单一企业领域扩展至航空公司客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交付(HRSD)三个领域,共涵盖 121 个工具、213 个场景,场景数较原始版本增长约 4 倍。每个场景均经 OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6 验证可解性。数据集遵循语音优先、真实性、多样性、认证流程和可复现性五项设计原则,包含单…
信息来源:Hugging Face:Blog(RSS) · OpenAI / GPT / Claude
观点 / 方法精选
OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?
OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
观点 / 方法精选
OpenRouter 横评 11 款 LLM 机器人冲刺对决:Claude 与 Grok 谁更胜一筹?
OpenRouter 在 30 场机器人冲刺对决中测试了 11 款大语言模型,共耗 482 美元推理成本。结果指向一个发现:应该重新审视模型 benchmark 的解读方式。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
观点 / 方法精选
OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔
OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的"大逃杀"挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
论文研究精选
Nemotron 预训练的任务种子合成问答生成
在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotr…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
论文研究精选
RHO:利用过往轨迹优化LLM智能体工具链的自监督方法
Retrospective Harness Optimization (RHO) 是一种自监督方法,仅利用过往轨迹优化LLM智能体的工具链(技能、工具和工作流程集合)。RHO从历史任务中选取多样化的困难任务核心集,并行重新执行;智能体通过自我验证和自我一致性分析回放,生成候选工具链更新,并依据自身成对自我偏好选择最有效更新。在软件工程、技术工作和知识工作三个领域评估中,单轮优化将SWE-Bench Pro通过率从59%提升至78%,无需外部评分。分析表明RHO有效针对先前失…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
Dreaming: ChatGPT 推出更强的记忆系统,更好记住用户偏好
ChatGPT 推出名为 Dreaming 的新记忆系统,能够更有效地记住用户偏好,并在跨对话场景中保持上下文的新鲜感和相关性,从而提升助手的个性化体验。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
产品发布 / 更新精选
Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习
Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。
信息来源:MarkTechPost(RSS)
产品发布 / 更新精选
Grok 登陆 Cloudflare AI Gateway
xAI 与 Cloudflare 合作,将 Grok 的 LLM、音频、图像和视频模型接入 Cloudflare AI Gateway,用户可直接通过 Cloudflare 计费,无需额外认证或 API 密钥。Elon Musk 发推称 "Grok on Cloudflare"。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
模型发布 / 更新精选
Grok Imagine 1.5制作《伊利亚特》预告片
伊利亚特(特洛伊)预告片由刚刚发布的 Grok Imagine 1.5 制作
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
行业动态精选
联合国报告:2030年AI数据中心水电消耗将翻倍
联合国大学水、环境与健康研究所报告指出,受AI需求驱动,去年全球数据中心耗电448太瓦时(AI占五分之一),耗水4.5万亿升,碳排放1.89亿吨。预计到2030年,年耗电量将翻倍至945太瓦时(AI占40%),耗水增至9.3万亿升,碳排放升至3.99亿吨,占地面积从6900平方公里扩展至14500平方公里。报告警告若忽视环境成本,AI落地还将加剧土地紧张与电子废弃物问题。
信息来源:IT之家(RSS)
模型发布 / 更新精选
Grok Imagine视频生成上线Vercel
Vercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: `await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });`
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新精选
Hugging Face 为编码智能体重塑 hf CLI 输出格式
Hugging Face 重新设计 hf CLI,使其同时服务人类用户和编码智能体(Claude Code、Codex 等)。CLI 通过环境变量自动检测智能体驱动,输出紧凑无截断的 TSV 格式,避免 ANSI 和交互提示,大幅降低 token 消耗。复杂多步任务中,不使用 CLI 的智能体 token 消耗最高达 hf CLI 的 6 倍。2026 年 4 月起,Hugging Face 追踪 Hub 智能体流量,Claude Code 约 4 万用户、近 4900 万…
信息来源:Hugging Face:Blog(RSS) · Claude / Hugging Face
行业动态精选
深陷版权诉讼仍受资本热捧,AI 音乐生成公司 Suno 再融资 4 亿美元
AI 音乐生成企业 Suno 完成 4 亿美元 D 轮融资,投后估值 54 亿美元,较七个月前 C 轮估值翻番。公司承认使用受版权保护歌曲训练 AI 模型,但辩称符合合理使用原则。索尼与环球音乐 2024 年首次起诉后,涉案曲目从 560 首增至超 6.1 万首;华纳音乐于 2024 年 11 月与 Suno 和解并签订授权协议。本轮由 Bond Capital 领投,用户日均生成 AI 歌曲超 700 万首。
信息来源:IT之家(RSS)
产品发布 / 更新精选
Grok模型登陆Cloudflare AI Gateway
在 @Cloudflare 的 AI Gateway 上尝试 Grok 模型!
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
模型发布 / 更新精选
GPT-Rosalind 重大升级,提升药物发现智能
GPT-Rosalind 重大升级,药物发现、分析、设计和实验工作流的智能大幅提升:
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
MiniMax M3联袂Mem0推持久记忆AI
Mem0 是 MiniMax M3 的官方启动合作伙伴! M3 的 1M token 上下文窗口 + @mem0ai 的记忆层 = 真正记住的 AI 应用。 构建具有持久记忆的个性化 AI 智能体,现在启动周内 M3 享五折优惠。 开始使用 Minimax → https://platform.minimax.io/docs/guides/models-intro 注册 mem0 → http://app.mem0.ai/?utm_source=minimax_x_post
信息来源:X:MiniMax (@MiniMax_AI)
产品发布 / 更新精选
Claude Code v2.1.162 发布
Claude Code v2.1.162 发布,主要包含 Bug 修复和体验优化。`claude agents --json` 新增 `waitingFor` 字段,`/effort` 命令确认级别持久化,远程控制固定底部显示,`/ide` 菜单中 Windsurf 更名为 Devin Desktop。修复了配置文件只读导致启动黑屏、Windows 权限规则不匹配、LSP 的 `workspaceSymbol` 无结果、API 400 错误、MCP 超时低于 1000ms …
信息来源:Claude Code:GitHub Releases(RSS) · Claude
观点 / 方法精选
不,人工智能没有意识--陈景德
科幻作家陈景德(Ted Chiang)在《大西洋月刊》发表评论,直接否定人工智能具备意识的可能性。文章从哲学和认知科学角度论证,当前的大语言模型仅是模式匹配与文本生成的统计系统,并不拥有主观体验或自我意识。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态精选
OpenAI发布前沿AI民主治理与安全蓝图
我们发布了一份关于前沿AI民主治理的蓝图, 以及美国如何为前沿AI安全建立持久的机构。
信息来源:X:Greg Brockman (@gdb) · OpenAI
模型发布 / 更新精选
Gemma 4 12B发布:笔记本本地运行的多步推理模型
Gemma 4 系列累计下载量突破1.5亿次,Google随之推出新成员Gemma 4 12B。该模型仅12B参数,可在16GB VRAM笔记本上本地运行,兼顾尺寸与性能,支持多步推理和智能体工作流。采用Apache 2.0开源许可,供社区使用。
信息来源:X:Sundar Pichai (@sundarpichai)
观点 / 方法精选
世界模型的功能分类
World Labs团队与李飞飞发文,梳理"世界模型"这一被滥用的术语。对比语言模型学习文本统计,世界模型学习空间与时间统计(如光照、物理规律)。基于部分可观马尔可夫决策过程(POMDP)框架,智能体通过动作影响世界状态,观测是部分视图。当前被称为"世界模型"的不同系统本质上是同一循环的不同投影:第一类为渲染器,输出给人眼看的像素,以视觉保真度为核心。文章着重于概念分层,未给出具体模型名、参数或基准分数。
信息来源:X:Fei-Fei Li (@drfeifei, World Labs)
模型发布 / 更新精选
Gemma 4 12B 发布:150M+ 下载量里程碑,16GB VRAM 本地运行
Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。
信息来源:X:Demis Hassabis (@demishassabis)
观点 / 方法精选
大型人工智能公司的一半股份应归公众所有
美国参议员伯尼·桑德斯(Bernie Sanders)在其官网发布的专栏文章中提出,大型人工智能公司的一半股份应归公众所有。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
Ideogram v4.0 发布:2K 分辨率和 JSON 提示支持
介绍 Ideogram v4.0。 原生 2K 分辨率,出色的文字渲染,支持 JSON 提示词。 立即在 Krea 中体验。
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
Gemma 4 12B:一种统一的、无需编码器的多模态模型
Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)