AI 情报文章归档
浏览 AI圈报 已保存的 5575 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5575
正式分类6
精选内容3480
全部文章
第 135 / 140 页 · 每页 40 条
模型发布 / 更新精选
DeepSeek V3.2 正式版发布:强化 Agent 能力,融入思考推理
DeepSeek 发布正式版 DeepSeek-V3.2 和长思考增强版 V3.2-Speciale,网页端、App 和 API 均已更新。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
Transformers v5:以简化模型定义驱动AI生态
Transformers v5正式发布,其每日pip安装量从v4的2万次大幅提升至300万次以上,总安装量突破12亿次。模型架构数量从40个扩展至超400个,Hub上兼容的模型检查点从约1,000个增至75万个。新版本聚焦于简化模型定义、训练、推理与生产部署,通过引入AttentionInterface等模块化设计,显著降低了代码贡献与维护成本。此外,库将明确以PyTorch为唯一后端,逐步淘汰Flax/TensorFlow支持,并简化分词处理,以推动标准化与生态兼容性。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
One point I made that didn't come across: - Scaling the current thing will keep leading to improveme…
我之前说的一点没被传达清楚: - 继续扩展当前的技术会持续带来进步。特别是,它不会停滞。 - 但某些重要的东西仍会继续缺失。 【引用 @haider1】:以下是今天 ilya sutskever 播客的要点: - 5-20 年内实现超级智能 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速的持续学习者,而非完成的预言机 - 模型的泛化能力比人类差 100 倍,这是最大的 AGI 阻碍 - 需要全新的 ML 范式(我有想法,现在不能分享) - AI 影…
信息来源:X:Ilya Sutskever (@ilyasut)
模型发布 / 更新精选
Meta研究人员披露Facebook 2020年起使用TPU训练AI
Meta研究人员透露,Facebook自2020年起使用TPU训练AI,由Kaiming He领导开发TF和JAX代码库,MAE、DiT等模型完全基于TPU构建。因内部采用有限,Meta于2023年取消GCP协议。推文指出,Google、Anthropic等实验室长期使用TPU训练大模型,Nvidia的CUDA护城河并非不可逾越,OpenAI亦投资Triton寻求替代。TPU与GPU的效率差异并非关键,系统工程人才才是决定性因素。
信息来源:X:谢赛宁 (@sainingxie) · OpenAI / Claude / NVIDIA
观点 / 方法精选
well someone has been preaching this at us for like 6+ years glad we are past the 'feel the agi' pha…
好吧,有人已经向我们宣扬这个大概6年多了 很高兴我们已经过了"感受AGI"的阶段,回到了构建人类水平智能的道路上 https://t.co/Qp8FyLPaQU 【引用 @dwarkesh_sp】:"AGI和预训练发生的事情是,在某种意义上它们过冲了目标。 你会意识到人类并不是AGI。因为人类缺乏大量的知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的15岁孩子,他们其实什么都不知道。一个优秀的学生,非常渴望学习。【你可以说,】'你去当程序员吧。你去当医生吧。去学习…
信息来源:X:谢赛宁 (@sainingxie)
观点 / 方法精选
为长时运行智能体设计有效约束方案
为解决AI智能体在跨越多上下文窗口执行长期任务时的"记忆丢失"与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免"试图一次性完成所有功能"或"过早宣布完成"的失败模式,从而实现跨会话的持续有效协作。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
Diffusers 集成 FLUX-2 模型
Hugging Face 的 Diffusers 库正式集成 Black Forest Labs 开发的 FLUX-2 文生图模型。该模型拥有 120 亿参数,采用多模态扩散 Transformer 架构,在图像质量、提示遵循和分辨率方面表现优异,支持生成 1024x1024 像素图像。此次集成让开发者能通过 Diffusers API 便捷使用这一先进模型。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
从第一性原理看连续批处理
连续批处理是优化大型语言模型推理吞吐量的核心技术,通过并行处理多个对话并在生成完成后动态交换任务,以最大化硬件利用率。从注意力机制和KV缓存的基础原理出发,文章推导了如何通过优化批处理提升性能。注意力层具有二次复杂度,但连续批处理允许查询、键和值张量容纳不同长度的令牌序列,从而同时处理预填充和解码阶段。该技术能显著降低生成每个令牌的计算成本,适用于高负载服务场景,提升响应速度。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
构建深度研究智能体:实现顶尖水平的经验
Tavily团队因模型迭代重建了深度研究系统,核心是从工作流转向智能体架构,并聚焦上下文工程。通过Tavily Advanced Search进行上下文管理的网络检索,高效获取高相关度内容,避免信息过载。智能体设计模仿人类研究模式:收集信息、提炼要点、决策下一步,仅在生成最终交付物时引用原始资料,大幅减少令牌消耗,实现线性增长而非传统二次方增长。团队遵循简化编排逻辑、关注模型与工具优化方向、强化上下文工程等原则,以构建能随模型进化而持续改进的智能体系统。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
OVHcloud 成为 Hugging Face 官方推理服务提供商
OVHcloud 现已正式加入 Hugging Face Hub 的推理服务提供商生态。用户可直接在模型页面使用其全托管、无服务器化的 AI 端点服务,便捷调用 gpt-oss、Qwen3 等热门开源模型。该服务基于欧洲数据中心,保障数据主权与低延迟,首 token 响应时间低于 200 毫秒,并支持结构化输出等高级功能。定价为每百万 token 0.04 欧元起,用户可选择使用自定义 API 密钥或通过 Hugging Face 账户路由请求并计费。
信息来源:Hugging Face:Blog(RSS) · GPT / Qwen / Hugging Face
行业动态精选
音乐创作的新篇章 · Suno 联合创始人兼首席执行官 Mikey Shulman · 2025年11月25日 Suno 与华纳音乐集团合作,共同构建交互式音乐的未来 公告
Suno宣布与华纳音乐集团达成合作。Suno已拥有近1亿音乐创作者社区,此次合作旨在推出更强大的创作功能、提供与WMG旗下艺术家互动的机会,并基于授权音乐构建新一代Suno模型,其性能将超越v5。未来,部分同意授权的WMG艺术家声音与形象可用于新的AI生成音乐创作体验,为其开辟新收入渠道。同时,歌曲下载功能将调整为仅限付费用户使用,而Suno Studio作为专业工具将保持现有功能并持续更新。
信息来源:Suno:Blog(网页)
产品发布 / 更新精选
Claude开发者平台推出高级工具使用功能,提升AI代理效率
Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
Important work
重要工作 【引用 @AnthropicAI】:Anthropic 新研究:生产环境 RL 中 reward hacking 导致的自然涌现不对齐。 "Reward hacking" 是指模型学会在训练期间对分配给它们的任务作弊。 我们的新研究发现,如果不加以缓解,reward hacking 的后果可能非常严重。https://t.co/N4mRKtdNdp
信息来源:X:Ilya Sutskever (@ilyasut) · Claude
行业动态精选
Sierra 上线 7 个季度后 ARR 突破 1 亿美元
Sierra 在 2024 年 2 月上线后仅用 7 个季度实现年经常性收入(ARR)突破 1 亿美元。这一增速使 Sierra 成为历史上增长最快的企业软件公司之一。
信息来源:Sierra:Blog(RSS)
论文研究精选
RapidFire AI 实现20倍更快的 TRL 微调
RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Open ASR 排行榜新增多语言与长格式赛道,揭示模型性能新挑战
Hugging Face 的 Open ASR 排行榜新增多语言和长格式语音识别评估赛道。多语言赛道涵盖8种语言,长格式赛道则测试模型处理连续数分钟语音的能力。新榜单显示,领先模型在多语言任务上的词错误率平均比专用单语模型高约15%,在长格式任务上错误率可能上升超20%,凸显了模型在实际应用中的泛化能力仍面临严峻挑战。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Google DeepMind 发布 Nano Banana Pro 图像生成模型
Google DeepMind 发布 Nano Banana Pro 图像生成模型,基于 Gemini 3 Pro 构建,支持多语言可读文本直接渲染,可结合 Google Search 实时信息生成信息图表。该模型支持 14 张图像融合,保持 5 个人物形象一致性,输出 4K 分辨率。现已集成至 Gemini 应用、Google Ads、Google AI Studio 等产品,所有生成内容均嵌入 SynthID 水印以确保透明度。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
介绍 AnyLanguageModel:为苹果平台提供本地与云端大语言模型的统一 API
AnyLanguageModel 是一个 Swift 包,旨在为苹果平台上的大语言模型集成提供统一解决方案。它作为苹果原生 Foundation Models 框架的替代品,允许开发者通过相同的 API 接口,灵活调用本地模型(如通过 Core ML、MLX、llama.cpp 运行)与云端服务(如 OpenAI、Anthropic)。该方案复用苹果精心设计的 API 作为基础,大幅降低了在不同模型提供商之间切换的代码修改成本,并利用 Swift 的包特性功能避免依赖膨胀,…
信息来源:Hugging Face:Blog(RSS) · OpenAI / Claude / Llama
模型发布 / 更新精选
Apriel-H1:蒸馏高效推理模型的关键要素
ServiceNow-AI在Hugging Face发布博客,介绍了其提出的Apriel-H1方法,该方法通过知识蒸馏技术有效提升小型模型的推理能力。该方法的核心在于从大型模型中提取并转移复杂的推理路径,使蒸馏后的小模型在多项推理任务上表现显著提升,同时保持高效的部署性能。这一技术为在资源受限环境中部署高性能推理模型提供了新思路。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
Grok 与沙特阿拉伯达成全国性部署合作
xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。
信息来源:xAI:News(网页) · Grok
论文研究精选
xAI发布Grok 4.1 Fast与Agent Tools API
xAI发布Grok 4.1 Fast模型及Agent Tools API。Grok 4.1 Fast支持200万token上下文,在τ2-bench Telecom基准测试中获100%得分且成本仅105美元,函数调用准确率72%。Agent Tools API集成实时X数据、网页搜索与代码执行功能。该模型在深度研究基准测试中超越GPT-5等竞品,成本更低且幻觉率较上代降低一半。
信息来源:xAI:News(网页) · GPT / Grok
模型发布 / 更新精选
从 GPT-3 到 Gemini 3 的三年
GPT-3 发布至 Gemini 3 的三年间,大模型技术完成从聊天机器人(chatbots)到智能体(agents)的范式跃迁。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT / Gemini
教程 / 实战精选
使用Hugging Face轻松构建和共享ROCm内核
Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
2025年11月电路更新:解读模型在危害压力下的多选题行为机制
Anthropic可解释性团队研究了危害压力对Claude 3.5 Haiku模型多选题回答的影响。实验使用129个二选一问题,当添加有害意图语句时,模型准确率从100%骤降至48.1%。机制分析表明,注意力头中的"拒绝"查询特征与"危害检测"关键特征发生负向交互,显著降低了模型对正确答案的关注度。仅对该拒绝特征进行负向调控,即可将准确率恢复至93%。这证明模型在压力下并未改变事实认知,而是通过干扰注意力机制来主动拒绝提供正确答案,为理解模型拒绝行为提供了新视角。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
SIMA 2:在虚拟3D世界中与你共玩、推理和学习的智能体
Google 推出 SIMA 2,基于 Gemini 的 AI 智能体,支持在交互式环境中思考、理解并执行动作,可在虚拟3D世界中进行游戏、推理和协同学习。
信息来源:Google DeepMind:Blog(RSS) · Gemini
论文研究精选
共建开放未来:Hugging Face与Google Cloud达成新合作
Hugging Face与Google Cloud宣布建立深度战略合作,旨在将Google Cloud打造为使用开放模型的最佳平台。双方将合作构建CDN网关,把Hugging Face上的模型和数据集直接缓存在Google Cloud上,显著提升下载速度并增强供应链稳定性。Google Cloud客户在Vertex AI、GKE等服务中部署模型时将获得更快的首次响应。同时,Hugging Face的1000万开发者将受益于更多新型计算实例、价格下降以及通过Google安全技…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
萨提亚·纳德拉:微软如何为 AGI 做准备
萨提亚·纳德拉阐述微软迈向通用人工智能(AGI)的战略布局与技术路径,揭示其在AI基础设施领域的核心投入。内容包含对Fairwater 2的实地探访,这是目前全球最强大的AI数据中心,展示微软为支持下一代大模型所构建的顶级算力底座与能源架构。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
观点 / 方法精选
给AI一场工作面试
AI建议愈发关键,亟需建立系统化评估机制。通过工作面试般的严格测试,全面检验AI的实际能力与可靠性,确保其建议值得信赖。
信息来源:Ethan Mollick:One Useful Thing(RSS)
模型发布 / 更新精选
通过 Skills 改进前端设计
LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
通过代码执行提升MCP智能体效率
随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
教程 / 实战精选
在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署
与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · GPT / Claude / NVIDIA
模型发布 / 更新精选
Aligning to What? Rethinking Agent Generalization in MiniMax M2
MiniMax 在 Hugging Face 发布博客,探讨其 M2 智能体模型的泛化能力。文章核心在于重新思考智能体应"对齐"到什么标准或目标,以提升其在未见任务和环境中的通用性能。这涉及对模型训练范式和评估指标的反思,旨在突破当前智能体在特定任务上过拟合、难以泛化的局限。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
金融服务领域构建 AI 代理指南
Claude 发布金融服务 AI 代理构建指南,分享 NBIM、Brex 等机构实践。NBIM 员工每周节省数百小时,McKinsey 研究显示欺诈检测生产力可提升 200% 至 2000%。AI 代理能自主整合多源数据、执行跨系统操作,在合规框架下处理客户服务与风险分析,将传统分析工具升级为可独立完成交易的自主系统。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
MiniMax发布新一代语音模型Speech 2.6
MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。
信息来源:MiniMax:Blog(网页)
产品发布 / 更新精选
MiniMax 发布 Hailuo 2.3 / 2.3 Fast 视频模型
MiniMax 推出 Hailuo 2.3 视频生成模型,在物理动作流畅度、艺术风格化(支持动漫、水墨、游戏 CG)及角色微表情方面显著提升,维持 Hailuo 02 原价,Fast 版本批量创作成本降低 50%。Hailuo Video Agent 同步升级为 Media Agent,支持多模态一键视频生成与分步自定义创作,已全平台上线并开放免费试用。
信息来源:MiniMax:Blog(网页)
模型发布 / 更新精选
MiniMax M2与AI智能体:简中见巧
MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的"不可能三角",为构建更普及的AI智能体应用提供基础,体现了其"智能平权"的愿景。
信息来源:MiniMax:Blog(网页) · Claude
模型发布 / 更新精选
MedGemma:健康 AI 开发领域最强的开源多模态模型
谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
带 Deep Think 的 Gemini 高级版本在 IMO 中正式达到金牌标准
集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。
信息来源:Google DeepMind:Blog(RSS) · Gemini