AI 情报文章归档
浏览 AI圈报 已保存的 5559 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5559
正式分类6
精选内容3470
全部文章
第 134 / 139 页 · 每页 40 条
论文研究精选
机器人领域的三大困境:硬件可靠性、基准测试与VLA局限
硬件方面,Optimus等虽工程精湛,但可靠性不足严重限制软件迭代,且维护成本高昂。基准测试领域仍处混乱,缺乏统一的硬件平台、任务定义和评分标准,cherry-picking现象普遍,可复现性堪忧。VLA(Vision-Language-Action)方法基于VLM存在本质缺陷:VLM为视觉问答优化,参数侧重语言知识而非物理理解,且视觉编码器丢弃低层细节,不利于精细操作。作者认为视频世界模型是更优的预训练目标。
信息来源:X:Jim Fan (@DrJimFan)
产品发布 / 更新精选
2024: AI is the copilot 2025+: humans are the copilot Copilot is the new engineering skill. It's not…
2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易--我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 【引用 @karpathy】:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新…
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
可蒸馏模型与合成数据管道:使用 NeMo Data Designer
介绍如何利用 NeMo Data Designer 构建许可安全的合成数据工作流,用于模型特化(model specialization)。该管道支持生成可蒸馏模型所需的高质量合成数据,确保数据来源合规,适用于下游微调与领域适配场景。
信息来源:OpenRouter:Announcements(RSS)
观点 / 方法精选
晚购特斯拉却早试FSD v14:首个通过物理图灵测试的AI体验
作者虽晚购特斯拉却率先体验FSD v14,认为这是首个通过"物理图灵测试"的AI系统:疲惫下班后只需按下按钮放松休息,已无法分辨是神经网络还是人类在驾驶。尽管深知机器人学习原理,方向盘自动转动时的流畅表现仍令人震撼。这项技术正从超现实体验转变为日常习惯,最终如智能手机般不可或缺。这种对"神级技术"的深度依赖,正在从根本上重塑人类行为模式。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
not getting into a philosophical debate, but this book really changed how I see the topic and made m…
不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 【引用 @demishassabis】:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用…
信息来源:X:谢赛宁 (@sainingxie)
模型发布 / 更新精选
以 AI 支持 DOW 的使命
xAI 被美国战争部(DOW)选中,为其 GenAI.Mil 套件提供 Frontier AI 系统。基于 Grok 模型的解决方案将覆盖 DOW 旗下 300 万军事和文职人员,支持 Impact Level 5(IL5)级别的企业 AI 和关键任务用例,可嵌入从五角大楼到战术边缘的日常工作流,并支持机密作战工作负载。DOW 用户还可独家获取 X 平台实时全球洞察。
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
GLM-4.7:更强的 Coding
GLM-4.7 发布,编程能力显著提升。SWE-bench 达 73.8%(+5.8%),Terminal Bench 2.0 达 41%(+16.5%),支持 Claude Code 等主流智能体框架。新增交错式思考、保留式思考和轮级思考功能,可控制推理过程以降低延迟或提高准确性。同步改进 UI 生成、工具调用和数学推理能力,可通过 API 或本地部署使用。
信息来源:智谱:研究(网页内嵌数据) · Claude / GLM
产品发布 / 更新精选
Response Healing:将 JSON 缺陷减少 80% 以上
OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
OpenRouter 推出 Response Healing:将 JSON 缺陷减少 80% 以上
OpenRouter 推出 Response Healing 新功能,可在响应到达应用前自动修复大语言模型产生的格式错误的 JSON,从而将 JSON 缺陷减少 80% 以上。
信息来源:OpenRouter:Announcements(RSS)
模型发布 / 更新精选
Transformers v5 中的分词:更简单、清晰与模块化
Transformers v5 发布了全新的分词处理架构,核心变化是引入了更简单、统一的 API 设计,将分词器、后处理器和解码器模块化。新版移除了大量遗留代码,使代码库体积减少了约 40%,并显著提升了处理长文本和特殊 token 的灵活性。这一改进旨在降低开发者使用门槛,同时为各类大语言模型(如 GPT、Claude、LLaMA)提供更高效、一致的分词支持。
信息来源:Hugging Face:Blog(RSS) · GPT / Claude / Llama
模型发布 / 更新精选
Gemini 3 Flash:专为速度打造的前沿智能
Gemini 3 Flash 正式发布,在大幅降低使用成本的同时提供前沿级智能,主打极速推理性能,为需要快速响应的 AI 应用提供高性价比选择。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
xAI 发布 Grok Voice Agent API
xAI 开放 Grok Voice Agent API,基于自研语音栈(VAD、tokenizer、音频模型),Big Bench Audio 基准排名第一,首音频延迟低于 1 秒(比竞品快近 5 倍),定价 $0.05/分钟。支持数十种语言自动切换、实时搜索 X 和网页、调用自定义工具,已深度集成特斯拉车机。提供 Ara、Eve 等多种自然声线,支持 【whisper】 等听觉标签,兼容 OpenAI Realtime API 规范。
信息来源:xAI:News(网页) · OpenAI / Grok
论文研究精选
new paper: iREPA diffusion models are a renderer of their underlying representations. with this new…
新论文:iREPA 扩散模型是其底层表征的渲染器。通过这种新设置,我们能更清楚地洞察这些表征的真正含义。Jas 开始了一场自发的探索,过去三个月我们学到了很多 ps. 这也是我们对一种新型线上"饮水机效应"的小实验,我很喜欢看到这种现象。让我们争论、讨论,然后用真正的努力将其转化为正经科学 【引用 @1jaskiratsingh】:!!️ 表征对生成很重要!但事实证明,我们对表征如何帮助生成的理解一直都是错的 !!️ 我们之前的想法:(我们错了) ❌ 更大的视觉编码器 → …
信息来源:X:谢赛宁 (@sainingxie)
教程 / 实战精选
CUGA 登陆 Hugging Face:普及可配置的通用 AI 智能体
开源可配置通用智能体 CUGA 现已集成至 Hugging Face Spaces,便于开发者便捷实验。该智能体在复杂任务基准测试中表现卓越,在包含 457 个 API、750 个真实任务的 AppWorld 基准排名第一,在 WebArena 基准也位居前列。其核心提供可配置的推理模式以平衡性能与成本,支持计算机使用与多工具无缝集成,并能与 Langflow 结合进行低代码工作流设计。采用 Apache 2.0 许可的 CUGA 支持多种开源模型,在高性能推理平台(如 G…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
llama.cpp 服务器新增多模型管理功能
llama.cpp 服务器新增了类似 Ollama 的多模型管理功能。该功能采用多进程架构,每个模型独立运行,确保单个模型崩溃不影响其他服务。系统支持自动发现本地 GGUF 模型文件、按需加载,并默认采用 LRU 机制管理最多同时加载4个模型。用户可通过请求中的模型字段路由到特定模型,并可使用 API 进行加载、卸载和列表查看。所有加载的模型可继承路由器的统一设置,也支持通过预设文件为每个模型单独配置参数。内置 Web UI 同样支持模型切换。
信息来源:Hugging Face:Blog(RSS) · Llama / Hugging Face / Ollama
模型发布 / 更新精选
GLM-TTS:基于多奖励融合强化学习,实现工业级语音合成
GLM-TTS 采用 GRPO 多奖励强化学习框架,融合字符错误率、相似度、情感及笑声奖励,实现 3 秒零样本音色克隆。在 seed-tts-eval 测试中 CER 低至 0.89% 达开源 SOTA,情感表达显著优于阿里、百度等商用模型。支持 15% 参数 LoRA 微调定制精品音色,通过 Phoneme-in 混合输入精准控制多音字发音,配合自研 2D-Vocos 声码器提升音质与音域覆盖。
信息来源:智谱:研究(网页内嵌数据) · GLM
模型发布 / 更新精选
GLM-ASR-Nano:面向真实世界的高鲁棒性语音识别
智谱发布开源语音识别模型 GLM-ASR-Nano,仅 1.5B 参数,面向真实世界场景优化鲁棒性,已落地智谱AI输入法。支持通过 Hugging Face Transformers 快速推理。
信息来源:智谱:研究(网页内嵌数据) · GLM / Hugging Face
模型发布 / 更新精选
Anthropic调研:2026年企业AI智能体应用趋势
Anthropic与Material调研500余位技术领导者显示,57%企业已将AI智能体用于多阶段工作流,16%实现跨职能部署。编码是核心场景,90%用于开发辅助,86%用于生产代码,平均节省近六成时间。80%受访者称投资已产生可衡量回报,如Thomson Reuters将法律检索从数小时缩短至分钟级。2026年81%企业计划处理更复杂用例,但面临系统集成、数据质量和变革管理三大挑战。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
GLM-4.6V:支持原生工具调用的开源多模态模型
智谱开源GLM-4.6V系列多模态模型,含106B-A12B基础版与9B轻量版Flash,支持128k tokens上下文。首次原生集成Function Call能力,支持图像、截图直接作为工具参数,并能理解工具返回的视觉内容。具备复杂文档理解、视觉网页搜索、前端代码生成及交互式编辑能力,适用于构建多模态Agent。已上架GitHub、Hugging Face及魔搭社区。
信息来源:智谱:研究(网页内嵌数据) · GLM / Hugging Face
模型发布 / 更新精选
介绍 swift-huggingface:完整的 Hugging Face Swift 客户端
swift-huggingface 是一个全新的 Swift 客户端,旨在彻底解决旧库下载模型缓慢、不可靠且不支持断点续传的问题。它提供完整的 Hub API 覆盖,核心改进包括具备进度跟踪和断点续传的可靠下载、与 Python 生态共享缓存以避免重复下载,以及通过灵活的 TokenProvider 模式简化身份验证。该库现已独立发布,并将很快集成到 swift-transformers 中取代原有实现,未来还将支持 Xet 存储后端以实现更快的下载。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
利用Claude微调开源大语言模型的新途径
Anthropic的研究人员探索了一种新方法:使用其强大的闭源AI助手Claude来生成高质量的指令遵循数据,并用这些数据对较小的开源模型(如LLaMA系列)进行监督微调。这项实验旨在展示如何利用尖端闭源模型的能力来指导和改进可公开访问的开源模型性能,从而推动AI技术的进步与民主化。
信息来源:Hugging Face:Blog(RSS) · Claude / Llama / Hugging Face
产品发布 / 更新精选
蚂蚁集团开源AState:面向强化学习的高性能状态管理系统
蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
行业动态精选
对 AI 进展的思考(2025年12月)
作者对人工智能发展作出阶段性预判:短期内持温和看跌态度,认为行业可能面临调整期或增速放缓;长期来看则极度看涨,预期将迎来爆发式增长。这一观点揭示了技术成熟度曲线中短期波动与长期变革潜力之间的典型张力,为2025年底的 AI 发展态势提供了审慎而前瞻的研判框架。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
论文研究精选
大规模验证代码的实用方法
研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。
信息来源:OpenAI:Alignment 研究博客(RSS) · OpenAI
模型发布 / 更新精选
DeepSeek V3.2 正式版发布:强化 Agent 能力,融入思考推理
DeepSeek 发布正式版 DeepSeek-V3.2 和长思考增强版 V3.2-Speciale,网页端、App 和 API 均已更新。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
Transformers v5:以简化模型定义驱动AI生态
Transformers v5正式发布,其每日pip安装量从v4的2万次大幅提升至300万次以上,总安装量突破12亿次。模型架构数量从40个扩展至超400个,Hub上兼容的模型检查点从约1,000个增至75万个。新版本聚焦于简化模型定义、训练、推理与生产部署,通过引入AttentionInterface等模块化设计,显著降低了代码贡献与维护成本。此外,库将明确以PyTorch为唯一后端,逐步淘汰Flax/TensorFlow支持,并简化分词处理,以推动标准化与生态兼容性。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
One point I made that didn't come across: - Scaling the current thing will keep leading to improveme…
我之前说的一点没被传达清楚: - 继续扩展当前的技术会持续带来进步。特别是,它不会停滞。 - 但某些重要的东西仍会继续缺失。 【引用 @haider1】:以下是今天 ilya sutskever 播客的要点: - 5-20 年内实现超级智能 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速的持续学习者,而非完成的预言机 - 模型的泛化能力比人类差 100 倍,这是最大的 AGI 阻碍 - 需要全新的 ML 范式(我有想法,现在不能分享) - AI 影…
信息来源:X:Ilya Sutskever (@ilyasut)
模型发布 / 更新精选
Meta研究人员披露Facebook 2020年起使用TPU训练AI
Meta研究人员透露,Facebook自2020年起使用TPU训练AI,由Kaiming He领导开发TF和JAX代码库,MAE、DiT等模型完全基于TPU构建。因内部采用有限,Meta于2023年取消GCP协议。推文指出,Google、Anthropic等实验室长期使用TPU训练大模型,Nvidia的CUDA护城河并非不可逾越,OpenAI亦投资Triton寻求替代。TPU与GPU的效率差异并非关键,系统工程人才才是决定性因素。
信息来源:X:谢赛宁 (@sainingxie) · OpenAI / Claude / NVIDIA
观点 / 方法精选
well someone has been preaching this at us for like 6+ years glad we are past the 'feel the agi' pha…
好吧,有人已经向我们宣扬这个大概6年多了 很高兴我们已经过了"感受AGI"的阶段,回到了构建人类水平智能的道路上 https://t.co/Qp8FyLPaQU 【引用 @dwarkesh_sp】:"AGI和预训练发生的事情是,在某种意义上它们过冲了目标。 你会意识到人类并不是AGI。因为人类缺乏大量的知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的15岁孩子,他们其实什么都不知道。一个优秀的学生,非常渴望学习。【你可以说,】'你去当程序员吧。你去当医生吧。去学习…
信息来源:X:谢赛宁 (@sainingxie)
观点 / 方法精选
为长时运行智能体设计有效约束方案
为解决AI智能体在跨越多上下文窗口执行长期任务时的"记忆丢失"与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免"试图一次性完成所有功能"或"过早宣布完成"的失败模式,从而实现跨会话的持续有效协作。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
Diffusers 集成 FLUX-2 模型
Hugging Face 的 Diffusers 库正式集成 Black Forest Labs 开发的 FLUX-2 文生图模型。该模型拥有 120 亿参数,采用多模态扩散 Transformer 架构,在图像质量、提示遵循和分辨率方面表现优异,支持生成 1024x1024 像素图像。此次集成让开发者能通过 Diffusers API 便捷使用这一先进模型。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
从第一性原理看连续批处理
连续批处理是优化大型语言模型推理吞吐量的核心技术,通过并行处理多个对话并在生成完成后动态交换任务,以最大化硬件利用率。从注意力机制和KV缓存的基础原理出发,文章推导了如何通过优化批处理提升性能。注意力层具有二次复杂度,但连续批处理允许查询、键和值张量容纳不同长度的令牌序列,从而同时处理预填充和解码阶段。该技术能显著降低生成每个令牌的计算成本,适用于高负载服务场景,提升响应速度。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
构建深度研究智能体:实现顶尖水平的经验
Tavily团队因模型迭代重建了深度研究系统,核心是从工作流转向智能体架构,并聚焦上下文工程。通过Tavily Advanced Search进行上下文管理的网络检索,高效获取高相关度内容,避免信息过载。智能体设计模仿人类研究模式:收集信息、提炼要点、决策下一步,仅在生成最终交付物时引用原始资料,大幅减少令牌消耗,实现线性增长而非传统二次方增长。团队遵循简化编排逻辑、关注模型与工具优化方向、强化上下文工程等原则,以构建能随模型进化而持续改进的智能体系统。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
OVHcloud 成为 Hugging Face 官方推理服务提供商
OVHcloud 现已正式加入 Hugging Face Hub 的推理服务提供商生态。用户可直接在模型页面使用其全托管、无服务器化的 AI 端点服务,便捷调用 gpt-oss、Qwen3 等热门开源模型。该服务基于欧洲数据中心,保障数据主权与低延迟,首 token 响应时间低于 200 毫秒,并支持结构化输出等高级功能。定价为每百万 token 0.04 欧元起,用户可选择使用自定义 API 密钥或通过 Hugging Face 账户路由请求并计费。
信息来源:Hugging Face:Blog(RSS) · GPT / Qwen / Hugging Face
行业动态精选
音乐创作的新篇章 · Suno 联合创始人兼首席执行官 Mikey Shulman · 2025年11月25日 Suno 与华纳音乐集团合作,共同构建交互式音乐的未来 公告
Suno宣布与华纳音乐集团达成合作。Suno已拥有近1亿音乐创作者社区,此次合作旨在推出更强大的创作功能、提供与WMG旗下艺术家互动的机会,并基于授权音乐构建新一代Suno模型,其性能将超越v5。未来,部分同意授权的WMG艺术家声音与形象可用于新的AI生成音乐创作体验,为其开辟新收入渠道。同时,歌曲下载功能将调整为仅限付费用户使用,而Suno Studio作为专业工具将保持现有功能并持续更新。
信息来源:Suno:Blog(网页)
产品发布 / 更新精选
Claude开发者平台推出高级工具使用功能,提升AI代理效率
Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
Important work
重要工作 【引用 @AnthropicAI】:Anthropic 新研究:生产环境 RL 中 reward hacking 导致的自然涌现不对齐。 "Reward hacking" 是指模型学会在训练期间对分配给它们的任务作弊。 我们的新研究发现,如果不加以缓解,reward hacking 的后果可能非常严重。https://t.co/N4mRKtdNdp
信息来源:X:Ilya Sutskever (@ilyasut) · Claude
行业动态精选
Sierra 上线 7 个季度后 ARR 突破 1 亿美元
Sierra 在 2024 年 2 月上线后仅用 7 个季度实现年经常性收入(ARR)突破 1 亿美元。这一增速使 Sierra 成为历史上增长最快的企业软件公司之一。
信息来源:Sierra:Blog(RSS)
论文研究精选
RapidFire AI 实现20倍更快的 TRL 微调
RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。
信息来源:Hugging Face:Blog(RSS) · Hugging Face