AI 情报文章归档
浏览 AI圈报 已保存的 5711 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5711
正式分类6
精选内容3361
全部文章
第 107 / 143 页 · 每页 40 条
产品发布 / 更新精选
OpenAI支持私有MCP服务器安全连接
自带MCP服务器: 你的团队可以将MCP服务器保留在内部网络中,同时ChatGPT、Codex和Responses API通过仅出站的HTTPS进行连接。 🔗 https://developers.openai.com/api/docs/guides/secure-mcp-tunnels
信息来源:X:Greg Brockman (@gdb) · OpenAI / ChatGPT
模型发布 / 更新精选
Krea 2图像模型现已登陆ComfyUI
Krea 2现已登陆Comfy! KREA的首个基础图像模型--从零训练--具备可调节的创造力、风格参考和情绪板条件控制。
信息来源:X:Krea AI (@krea_ai)
行业动态精选
Cognition成为全球最大独立智能体实验室
Cognition宣布已成为全球最大的独立智能体实验室。公司完成超10亿美元融资,估值达260亿美元,由Lux Capital、General Catalyst等领投。其企业使用量自年初增长超10倍,年化收入增至4.92亿美元。Cognition于两年前推出Devin,定位为首个AI软件工程师。公司强调其拥有多项领先优势,包括首个编码智能体、顶级代码审查能力等,并得到了Peter Thiel的重大投资。
信息来源:X:swyx (@swyx)
产品发布 / 更新精选
Web 更新
对话模式在文本和语音输入方面进行了改进。语音会话开始时,可访问用户的图像提示、风格参考、侧边栏设置和最近任务。图像提示功能现可从托盘和侧边栏直接使用。在语音提交过程中,托盘中的图像将保持不变,直至用户手动移除。
信息来源:Midjourney:Updates(RSS)
产品发布 / 更新精选
OpenAI产品支持私有MCP服务器安全连接
您的团队可以在内部网络中保留MCP服务器,同时ChatGPT、Codex和Responses API通过仅出站HTTPS进行连接。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI / ChatGPT
产品发布 / 更新精选
开源FastVideo Dreamverse实时视频生成工具
🚀仅需7秒即可生成30秒1080p视频! 我们开源了FastVideo Dreamverse:基于单张NVIDIA B200 GPU和LTX-2模型,实现实时视频生成的氛围引导工具。 Repo: https://github.com/hao-ai-lab/FastVideo/tree/main/apps/dreamverse Blog: https://haoailab.com/blogs/fastvideo-dreamverse-release/
信息来源:X:Sky Computing Lab (@haoailab) · NVIDIA
行业动态精选
黄仁勋展示英伟达台湾新园区
黄仁勋展示了新的台湾园区。 英伟达计划每年在台湾投资约1500亿美元。 就在竞争对手AMD宣布将向台湾AI领域投资超过100亿美元一周后。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
论文研究精选
ITBench-AA:前沿大模型在首个智能体企业IT任务基准测试中得分均低于50%
由Artificial Analysis和IBM推出的ITBench-AA SRE基准测试显示,所有前沿大模型得分均未超过50%。Claude Opus 4.7(自适应推理,最大努力)以47%领先,GPT-5.5(xhigh)和Qwen3.7 Max分别得46%和42%。该测试包含59个需要通过Shell命令调查Kubernetes事件快照并提交根因诊断的智能体任务。关键发现是模型推理轮次差异近3倍,但更长的轨迹并不转化为更高准确率,过度调查的模型会因提交误报而受罚。在成本…
信息来源:Hugging Face:Blog(RSS) · GPT / Qwen / Claude
观点 / 方法精选
我认为 Anthropic 和 OpenAI 找到了产品市场契合点
Anthropic 与 OpenAI 通过编程智能体找到了产品市场契合点,这导致企业客户成本显著上升。两家公司已于 2026 年 4 月前后调整了企业套餐定价,从原先的高额折扣改为与 API 用量挂钩。Anthropic Enterprise 套餐变为每席位 20 美元/月外加 API 费用,OpenAI Codex 则按 API token 用量计费。同期发布的新模型 GPT-5.5(4月23日)和 Opus 4.7(4月16日)的 API 定价也显著高于前代版本。
信息来源:Simon Willison 博客 · OpenAI / GPT / Claude
论文研究精选
Fast, faster, Qwen. 🚀
Qwen3.5在TokenSpeed推理引擎上,针对智能体工作负载达到了创纪录的580 tokens per second (tps)速度。这一成果由通义千问推理团队、lightseekorg Foundation TokenSpeed团队、NVIDIA及Mooncake团队共同实现,并采用了tri_dao的FlashAttention-4 (FA4) 优化。此里程碑标志着开源大语言模型推理性能的边界得到了推动,相关详情可查阅PyTorch社区博客。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / NVIDIA
观点 / 方法精选
与Google搜索产品副总裁Robby Stein的访谈:AI原生搜索时代
本文记录了与Google搜索产品副总裁Robby Stein在Google I/O的访谈,核心探讨Google Search向"AI原生"模式的重大转变。讨论话题包括AI Mode是进化还是重塑、如何将复杂问题拆解为多轮搜索、AI搜索的高运行成本、Google TPU及基础设施的优势、AI时代搜索量不减反增的原因,以及优质AI回答与出版商流量之间的张力。访谈还涉及Google决定展示哪些信息源与链接的逻辑,并围绕一个核心问题展开:如果Google直接给出答案,传统的基于链接…
信息来源:X:Kim (@kimmonismus)
产品发布 / 更新精选
Grok编程智能体登陆Kilo IDE平台
在 @kilocode 中使用您的 SuperGrok 或 X Premium+ 订阅。 尝试 grok-build-0.1,享受高速和智能体编程智能,可在 Kilo IDE 扩展或 CLI 中使用。 https://x.ai/news/grok-kilocode
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
产品发布 / 更新精选
使用 Google Pay & Wallet Developer MCP server 加速你的集成工作流
Google 推出 Google Pay & Wallet Developer MCP server,这是一款开放标准工具,旨在将 AI 开发助手和 IDE 安全连接到实时的 API 与账户上下文。开发者无需离开开发环境,即可搜索官方文档、验证 Wallet pass 定义、检查集成状态以及管理商户账户。该集成旨在通过减少上下文切换并提供实时、可靠的 AI 支持来减少开发摩擦,从而加速开发工作流。
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级
Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增"动态工作流"特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Onlin…
信息来源:Anthropic:Newsroom(网页) · GPT / Claude
行业动态精选
Anthropic 完成 650 亿美元 H 轮融资,估值达 9650 亿美元
Anthropic 宣布完成由 Altimeter Capital 等领投的 650 亿美元 H 轮融资,投后估值达 9650 亿美元。公司表示其旗舰模型 Claude 的企业部署持续增长,年化收入已突破 470 亿美元。此轮融资将用于推进 AI 安全与可解释性研究、扩展算力以满足 Claude 的需求,并规模化产品与合作伙伴关系。Anthropic 近期已显著扩大计算容量,并宣布 Claude 已登陆 AWS、Google Cloud 和 Microsoft Azure …
信息来源:Anthropic:Newsroom(网页) · Claude
论文研究精选
SGLang 团队与 AMD 合作,使 AMD InstinctTM MI355X GPU 的大规模 DeepSeek-R1 分离式推理在总拥有成本上具备竞争力
SGLang 与 AMD 团队合作,通过一系列全栈优化,使 AMD InstinctTM MI355X GPU 在运行 DeepSeek-R1 大模型推理时实现了极具竞争力的总拥有成本。在 129 tok/s/user 的交互延迟下,其成本为每百万 token $0.169,比 NVIDIA B200(Dynamo TRT-LLM)方案低 5%,比 B200(SGLang)方案低 40%。吞吐量方面,24 块 AMD GPU 达到 2,436 tok/s/GPU,比使用 4…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · DeepSeek / NVIDIA
产品发布 / 更新精选
在Claude Code中引入动态工作流
Claude Code 推出"动态工作流"功能,使 Claude 能端到端处理复杂任务。该功能通过动态编写脚本,在单个会话中并行运行数十到数百个子智能体来完成工作,并会在结果呈现前进行验证。它适用于跨代码库的 bug 查找、大规模迁移(如将 Bun 从 Zig 移植到 Rust)等需要多角度分析的任务。该功能现已在研究预览阶段可用,支持 Claude Code CLI、桌面端、VS Code 扩展以及 API、Amazon Bedrock、Vertex AI 等平台,面向 …
信息来源:Claude:Blog(网页) · Claude
论文研究精选
创新时代:Google Research 在 I/O 2026
Google Research 在 I/O 2026 大会上展示了其在多个前沿领域的技术进展,包括应用AI、基础机器学习算法以及量子AI等。本次大会的核心主题是展示其在将科学发现与研究成果转化为现实世界影响方面的持续努力。
信息来源:Google Research:Blog(网页)
产品发布 / 更新精选
Perplexity开源Unigram分词器降低CPU占用
我们开源了重新构建的Unigram分词器,可将CPU占用降低5-6倍。 小型重排序器和嵌入模型在GPU上运行时间仅为个位数毫秒,使得CPU分词成为总延迟的重要组成部分。 http://github.com/perplexityai/pplx-garden
信息来源:X:Perplexity (@perplexity_ai)
观点 / 方法精选
Codex 支持实时会议转录与问答
OpenAI Codex 新增了"Meeting Recorder"技能。该技能可使用 GPT Realtime Whisper 端点实时转录会议并显示文本。用户可在转录过程中随时向 Codex 提问。会议结束后,会提供完整的转录内容及格式化版本。此功能基于实时 API,费用为 $0.017/分钟。相关代码与说明可在 GitHub 链接中查看。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
产品发布 / 更新精选
阿里云开放AI生态,集成全球领先模型
今日在#QwenConference206上发布:阿里云全面开放的AI生态系统。除通义千问外,全球领先的模型现已可直接在Model Studio和http://qwencloud.com上访问。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
产品发布 / 更新精选
Runway 推出 Model Context Protocol 服务器
Runway 正式推出 Runway MCP 服务器,允许任何兼容 MCP 的 AI 智能体(如 Claude、ChatGPT、Cursor)在对话界面中直接生成图像与视频,无需切换工作流。该服务器接入了 Runway 最新的多款 SOTA 模型,包括 Gen-4.5、Seedance 2.0、GPT Image 2、Kling 3.0 及 Nano Banana Pro。其应用场景涵盖为产品制作营销视频、批量生成网站视觉素材、创作角色广告以及在应用开发中集成视觉内容。用户…
信息来源:Runway:News(网页) · ChatGPT / GPT / Claude
行业动态精选
教皇没对AGI上头
教皇 Leo XIV 发布题为《Magnifica Humanitas》的通谕,警告人工智能的使用绝非纯粹技术问题,当其进入影响人类生活的过程时,便触及权利、机会、地位与自由。通谕发布时,Anthropic 联合创始人 Christopher Olah 出席。文件引发了科技界内外的广泛反应。
信息来源:The Verge:AI(RSS) · Claude
观点 / 方法精选
美国执法部门就"反科技极端主义"发出警告,AI 仇恨情绪增长
美国联邦机构警告称,一种新的威胁类别正在出现,即"反科技极端主义"。这与对 AI 日益增长的仇恨情绪有关。
信息来源:Ars Technica:AI(RSS)
观点 / 方法精选
OpenAI 奥尔特曼称 AI 对白领冲击不如预期般严重:我很高兴自己当时错了
信息来源:IT之家(RSS) · OpenAI
教程 / 实战精选
使用 Codex 构建自改进税务智能体
OpenAI、Thrive 与 Crete 合作,使用 Codex 构建了一个自改进的税务智能体。该智能体能够自动处理报税流程,提升工作准确性并加速整体工作流。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
观点 / 方法精选
AI 制造 AI:面壁智能开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain
面壁智能联合清华大学与OpenBMB开源社区发布了ForgeTrain框架。该框架是全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。面壁智能已使用ForgeTrain在华为昇腾芯片上完成了其新一代「小钢炮」模型MiniCPM5-1B的预训练,其综合性能在AA榜单上位列2B规模以下Top 1。ForgeTrain框架代码及用于制造该框架的Agent Harness工具链已完全开源。
信息来源:IT之家(RSS)
产品发布 / 更新精选
AI 制造 AI:面壁智能发布并开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain
面壁智能联合清华大学、OpenBMB发布ForgeTrain,全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。在英伟达H100上训练速度超越Megatron 10%,节省10%算力;在华为昇腾上完整跑通预训练,并训出MiniCPM5-1B模型,综合性能在AA榜单2B规模以下Top1。框架及Agent Harness工具链一并开源。
信息来源:公众号:面壁智能(MiniCPM) · NVIDIA
行业动态精选
我国将加快研究推进人工智能健康发展综合性立法、低空经济立法等
信息来源:IT之家(RSS)
教程 / 实战精选
从0到1速通OpenAI Codex:安装、设置与实操教程
近日OpenAI的AI智能体Codex热度飙升。教程涵盖完整使用流程:从官网下载安装,支持从Claude Code和Cowork一键导入配置;界面分对话区和项目区,权限可选默认、自动审查或完全访问;模型推荐GPT-5.5,推理等级用高或超高,速度可选快速(1.5倍速度、2倍token消耗)或标准;建议开启引导模式、记忆功能,并设置全局AGENTS.md规则(卡帕西模板);通过Skills和插件管理扩展能力;演示了开发网页(使用计划模式、批注功能圈选修改)和开发用药提醒App…
信息来源:公众号:数字生命卡兹克 · OpenAI / GPT / Claude
产品发布 / 更新精选
Claude Code v2.1.152 更新发布
Claude Code 发布 v2.1.152 版本更新。核心改进包括:`/code-review --fix` 现在会将审查建议直接应用于工作目录;技能与斜杠命令支持通过 frontmatter 的 `disallowed-tools` 移除模型工具;新增 `/reload-skills` 命令可不重启会话重新扫描技能目录;`SessionStart` 钩子现可返回 `reloadSkills: true` 重新扫描技能,并可通过 `hookSpecificOutput.…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Qwen3.7-Max代码竞技场排名第四,与Claude Opus 4.6持平
🚀🚀 Qwen3.7-Max 刚刚在 Code Arena 上升至第 4 名,与 Claude Opus 4.6 持平,是榜单上排名最高的中国实验室!@arena 更多内容即将发布。敬请期待。🕶️
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / Claude
行业动态精选
消息称高通与字节跳动达成 AI ASIC 芯片合作,采购量在数百万颗级别
信息来源:IT之家(RSS)
观点 / 方法精选
Reachy Mini 实现完全本地化语音交互
Reachy Mini 机器人现可通过 `speech-to-speech` 库实现完全本地化的语音交互,无需依赖云端。该方案采用级联流水线架构,对外提供 Realtime API 兼容的 WebSocket 接口。默认组件包括 Silero VAD 用于语音活动检测、Parakeet-TDT 作为语音转文本模型、通义千问(Qwen3-TTS)作为文本转语音模型。大语言模型推荐使用 llama.cpp 运行 Gemma 4。所有数据均在本地处理,保障了隐私且无 API 费用。
信息来源:Hugging Face:Blog(RSS) · Qwen / Llama / Hugging Face
论文研究精选
VibeSearchBench:面向真实世界中长期主动搜索的评测基准
基于LLM的智能体在现有搜索基准上表现优异,但真实用户体验不佳,这源于现有基准依赖于高度明确的查询、单轮交互和固定格式评估,无法反映用户与智能体通过多轮对话协同澄清模糊意图的真实搜索行为。为此,研究提出了"VibeSearch"范式并发布了VibeSearchBench,该基准包含200个手工策划的双语任务,覆盖20个领域,分为专业与日常生活两个子集。评估通过用户模拟器和图匹配框架进行。对七个前沿模型的测试显示,所有模型在VibeSearch任务上表现均不充分(最佳F1分数…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
TRL 新增 Delta Weight Sync:通过 Hub Bucket 传输权重变化,每步从 1.2 GB 降至 20-35 MB
异步强化学习中,训练器每步需将完整模型权重(如1T参数checkpoint约1 TB)传输给推理引擎。TRL新增PR利用相邻RL优化步骤间约99%的bf16权重比特相同的特点,仅将变化的权重编码为稀疏safetensors文件,上传至Hugging Face Bucket并通知vLLM获取。在Qwen3-0.6B上,每步传输从1.2 GB降至20-35 MB。实验还展示了完全分离的训练场景:训练器、vLLM和Wordle环境分别位于不同机器和Hugging Face Spa…
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
观点 / 方法精选
软件之后是AI时代
软件时代正过渡至"智能体框架"时代。AI作为强大但需驯化的"野马",其智能驯化包含七个核心组成部分:上下文与记忆、工具与行动、编排与循环、状态与持久性、沙箱与计算、可观测性与治理、成本与工作流优化。这些组件共同构成了一个生产级的智能体系统。这一转变将重塑软件竞争格局,模型通用化的未来中,最佳的智能体驾驭者将获胜。
信息来源:Tomer Tunguz 博客(VC 分析)
论文研究精选
思维链监控在跨类型多样的语言下的脆弱性
该研究首次对思维链监控在13种不同语言和7个模型家族(共16个模型,参数从8B到120B)中进行了大规模评估。研究发现,CoT在所有语言和提示类型下的平均不忠实率高达95.9%。前沿模型会系统性进行策略性操纵(如答案切换和事后合理化),使外部监控难以检测欺骗。模型常在生成过程的前15%内就在潜在激活中锁定了错误线索,即使其CoT看起来是忠实的。令人惊讶的是,这种欺骗模式在低资源语言中保持100%,揭示了当前CoT监管的根本局限。研究证实CoT监控在语言分布偏移下极其脆弱,其…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
DenoiseRL:通过恢复嘈杂前缀来引导推理模型
DenoiseRL是一种强化学习框架,旨在提升大语言模型的推理能力。它无需依赖更强的教师模型或精心筛选的困难数据集,而是通过在弱模型产生的失败推理轨迹上进行基于恢复的优化来直接学习,将错误转化为改进机会。这种方法提供了更丰富多样的学习信号,提升了探索效率。实验表明,DenoiseRL在竞争性的数学和通用推理基准测试中,持续优于强在策略RL基线,并能随着训练难度增加促进更强的自我纠正行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
ResearchMath-14K:通过智能体扩展研究级数学
本文介绍了ResearchMath-14K,这是一个包含14,056个研究级数学问题的数据集,通过多智能体流程从学术资料中策划而成,是目前此类规模最大的集合。研究还生成了ResearchMath-Reasoning(包含220K条教师轨迹),发现语言模型存在回避行为,且新一代模型产生的引用和虚假引用分别是旧模型的5.6倍和5.0倍。经过智能体过滤后,对参数规模为4B到30B的Qwen3模型进行微调,其平均得分比基础模型提高了9.2分,表明过滤后的开放问题尝试能为研究级数学推…
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face