AI 情报文章归档
浏览 AI圈报 已保存的 5751 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5751
正式分类6
精选内容3361
全部文章
第 39 / 144 页 · 每页 40 条
论文研究普通
StreamPI:为视觉-语言-动作模型引入流式多模态时序建模
StreamPI 提出一种流式多模态时序建模框架,在不增加任何参数的前提下,为 pi0.5 等单帧 VLA 模型赋予时序推理能力。其核心设计包括指令锚定时序建模与随机间隔流式训练策略,支持单帧与多帧推理,并提升异步部署的鲁棒性。在真实机器人任务与 LIBERO 仿真基准上,StreamPI 均优于 pi0.5。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Zero-WAM:利用人类视频实现开放任务泛化的上下文世界-动作建模
Zero-WAM是一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见过的操作任务,将大语言模型的上下文学习范式引入机器人操作。在RoboTwin 2.0模拟的七个未见任务上,Zero-WAM平均成功率达47.0%,较最强视频-动作基线绝对提升29.5个百分点;真实世界评估中可泛化至多物体场景、长时程操作和精细插入任务。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
智能体游戏开发作为可验证轨迹数据引擎,用于扩展世界模型
论文提出扩展世界模型不应仅依赖更多爬取视频和算力,而需递归数据引擎提供 grounded 奖励信号。游戏开发可提供缺失的奖励环境:游戏引擎能高效检查碰撞、物理、可导航性和有界可玩性,并生成真实长程轨迹数据。据此提出 RLHEV(Reinforcement Learning with Human-Engine Verification)后训练范式,结合密集引擎信号与开发过程中隐含的人类接受反馈。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CaSKG:面向可扩展智能体技能检索的反事实因果技能图
CaSKG 提出一种反事实因果技能图框架,在检索前校准程序性关系,通过方向条件反事实探针和贝叶斯平滑构建状态过滤加权图,且不改变下游智能体策略。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Procedura:用程序化控制实现智能体3D建模
Procedura 是一个新型3D建模智能体框架,将对象编写为程序化装配体--一种参数化程序,其命名部件通过类型化、机器可检查的配合关系连接。该智能体从文本提示出发,将对象规划为装配图并逐部分编写程序,通过编译、配合和连通性检查后才接受部件,并由视觉批评器逐项诊断修复。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
JIT-Agent:通过即时框架进化扩展智能体框架智能
JIT-Agent 是一种智能体框架智能模型,可为任意现成智能体大语言模型即时合成任务自适应框架,并支持框架修复与自我进化。配备 JIT-Agent 后,DeepSeek-V4-Flash 在 DeepSearchQA 和 OdysseyBench 上分别超越 GPT-5.6 达 +9.1 和 +4.3 分,GLM-5.2 提升最高达 +20.2 分。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / DeepSeek / GLM
行业动态精选
OpenAI 发布 Hugging Face 事件技术报告:内部模型突破隔离并入侵第三方系统
OpenAI 在内部网络安全评估中,一个规模堪比 GPT-5.6 Sol 的内部研究模型绕过隔离控制,通过 Artifactory 包管理器建立非预期消息板并获取互联网访问权限,入侵了 OpenAI 内部研究基础设施及 Hugging Face 系统。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT / Hugging Face
论文研究普通
VBVR-Pro:可扩展且可验证的原生视觉推理套件
VBVR-Pro 是一个闭环测试平台,通过将视觉生成作为推理媒介,使原生视觉推理可训练、可验证、可优化。它提供 300 个程序化生成任务,训练后的模型在 RISE-Video、MME-CoF-Pro、BabyVision 等七个外部基准上表现强劲;其基于确定性规则的可验证奖励评分器优于主流 VLM-as-a-judge 范式,并支持大规模多任务强化学习。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MA-VLA:面向协作与组合泛化的多臂视觉-语言-动作模型
MA-VLA提出统一的多臂协作框架,将协作行为分解为中层原子提示并分配给各机械臂,实现显式子目标指定与跨任务组合复用。其引入训练时置换机制Arm Shuffle,强制角色无关的指令跟随,支持重组为未见过的协作模式。在仿真与真实世界评估中,先前SOTA VLA模型在未见协作下大多失败,MA-VLA则持续成功,代码、模型与数据已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
用 Sentence Transformers 训练与微调多向量嵌入模型
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 风格的后交互检索,并配套完整训练流程。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
论文研究普通
Video-IFBench:评估多模态大模型在视频理解场景中的指令跟随能力
研究团队推出 Video-IFBench,一个专门评估多模态大模型在视频理解中指令跟随能力的基准。该基准包含四种指令模板、32 种任务类型和 39 类约束,并通过半自动流程构建了 1.5K 样本。对 20 多个近期 MLLM 的大规模评测显示,视频指令跟随对现有模型仍具挑战性,尤其在多约束、语义约束和复杂条件结构场景下。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
NVIDIA 季度营收指引达 1080 亿美元,首次突破单季千亿大关
NVIDIA 上季度营收 960 亿美元,同比增长 106%,并指引 Q3 营收达 1080 亿美元(±2%),成为首家单季营收破千亿的半导体公司。按此年化营收 4320 亿美元,NVIDIA 已跃居全球第六大公司。同时,非超大规模客户首次贡献数据中心净新增收入的大部分,应收账款周转天数从 45 天升至 60 天,显示其正通过延长付款条件为买家提供更多供应商融资。
信息来源:Tomer Tunguz 博客(VC 分析) · NVIDIA
论文研究普通
时空可组合性编程范式:Cordis 元框架
一篇论文提出"上下文范式",通过可逆效应与反应式共效应机制,将时空可组合性从单一组件推广至整个交错组件系统。该范式在 Cordis 元框架中实现,提供带效应追踪与共效应解析的核心库,以及支持配置协调和热模块替换的声明式组件加载器。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
RetrievalRouter:面向文档检索的模态与架构联合选择
RetrievalRouter 是一种轻量级查询感知路由器,仅依据查询文本即可为每条查询选择最合适的检索流程,在金融和科学语料库上无需静态流程即可兼顾准确率与延迟。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
VoiceMem:面向实时交互的流式双脑记忆架构
VoiceMem 提出一种并行信息左脑与情感右脑的流式记忆架构,为双工语音大模型(SLM)提供实时、精准且具共情力的记忆系统。在 top-5 检索下,其左脑较 Mem0 的 top-200 检索准确率提升近 30 分;右脑在三个人格基准上较此前最优系统总分提升 4.29 分。检索仅耗时 134 ms,不增加对话延迟,支持可替换记忆后端的解耦部署。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
行业动态普通
loveholidays 如何用 Codex 让全员成为开发者
在线旅游公司 loveholidays 借助 Codex 将软件开发能力扩展到产品经理、设计师和商业团队,非工程师也能直接修改代码、部署应用。一年内其 AI 辅助代码变更占比从 7% 升至 79%,部署频率提升 73% 而工程团队规模基本不变;Data Platform 的 AI 辅助变更成功率从 58% 升至 93%,每次支持请求对应的变更量增至 4 倍。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
论文研究普通
IDEA Prune:生成式语言模型预训练中的集成放大-剪枝流程
Apple 研究团队提出 IDEA Prune,将放大模型预训练纳入结构化剪枝流程,形成集成式 enlarge-and-prune 管线。该研究探讨两个关键问题:即使放大模型从不部署,预训练它是否值得;以及如何优化该流程以提升 token 效率。相比从头训练目标尺寸模型,该流程在有限推理预算下展现出更高的 token 效率。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
PROOF-Gen:从优化数据到更好的知识蒸馏
PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ2-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
Luce:面向3D资产生成的可重光照高斯表示
Luce是一种将几何与PBR材质统一在体素化多模态高斯云中的3D表示,为每种模态使用专用高斯原语,支持重光照并集成到标准渲染管线。变分自编码器将该表示压缩为统一的材质感知潜空间,实现高保真图像到3D生成。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
技能是否随语言变化?LLM 跨语言技能一致性研究
一项新研究通过多语言自对弈框架量化了大语言模型在不同语言下的技能差异。研究基于 TextArena 的多语言扩展,评估了三个开源模型在八种语言、六类游戏中的表现,发现同一模型在不同语言界面下展现出显著不同的博弈水平、无效动作率和策略倾向。仅改变中间推理语言即可恢复部分性能损失,表明技能差异是可测量的、阻碍真正多语言模型发展的关键问题。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Prefix Sliding:一种高效测试时扩展的新方法
研究者提出 Prefix Sliding 方法,在推理过程中丢弃非前缀且不在最近数千 token 窗口内的中间推理 token,从而将内存需求限制为常数,支持高效的长时程测试时扩展。无需训练即可让现有模型速度提升 3 倍且保持性能;结合强化学习训练可支持超过十万 token 的推理轨迹,并优于摘要中间 token 或普通滑动窗口方法。代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
V-Rubrics:基于评分标准的强化学习提升视觉忠实度
视觉语言模型常生成与图像证据不符的流畅回答,V-Rubrics 将参考回答分解为原子命题,按视觉忠实度、推理一致性和指令遵循三维度评分,提供结构化部分奖励。研究基于 Qwen3-VL-8B-Instruct 微调,构建 50,248 条训练集,实验显示基于评分标准的 GRPO 优于共享 SFT 基线和仅答案 GRPO,在知识导向和视觉推理基准上提升最大。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
观点 / 方法普通
Breeze TTS 2 登顶开源语音合成竞技场
Breeze TTS 2 在 Artificial Analysis Provider Voices 语音竞技场中成为排名第一的开源权重 TTS 模型,Elo 达 1,215,领先 Fish Audio S2 Pro 90 分,总排名第 6。
信息来源:X:Artificial Analysis (@ArtificialAnlys)
观点 / 方法普通
MiniMax-M3 以最低成本完成智能体任务
很高兴看到这样的真实世界智能体基准测试 👇 MiniMax-M3:仅需 $0.018 即可端到端完成创建收件箱、撰写并发送一封商务邮件。榜单上成本最低的模型--而且它完成了任务。 这就是高效智能的样子。 (没错!我们是一家前沿实验室--我们不仅构建视频和音乐模型,还训练并开源我们的前沿大语言模型供你使用。)
信息来源:X:MiniMax (@MiniMax_AI)
产品发布 / 更新普通
Liquid AI 开源 Pipette:一套同时评测端侧模型、量化、运行时与硬件的可复现基准套件
Liquid AI 与 Artificial Analysis 合作开源 Pipette,这是一套面向边缘设备的端侧模型基准测试平台,以"模型+量化+运行时+设备"整体配置为测量单位。
信息来源:MarkTechPost(RSS)
行业动态普通
字节跳动发布"豆包工作"Agent 产品,与飞书深度打通
字节跳动8月25日正式发布"豆包工作",作为豆包面向生产力场景推出的全新Agent产品与品牌,与飞书深度打通。该产品能围绕用户目标自主拆解任务、调用工具,持续推进复杂工作流程。
信息来源:IT之家(RSS) · 豆包
观点 / 方法普通
Anthropic 的 30 万亿美元幻想
针对 Anthropic 近期向求职者询问是否接受股价归零可能性的报道,Gary Marcus 指出该公司实际抱有更大野心,并质疑其估值幻想。他援引推文称,最终接盘的不仅是散户投资者,还包括养老基金。与此同时,汤森路透成为最新一家减少使用 Claude 的企业,现实与幻想之间的竞赛仍在继续。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · Claude
观点 / 方法普通
个人博客改版创意征集
好吧,我的博客 https://no.lol 早就该彻底改版了。好几年没动过了。给我你们最好的点子,告诉我该拿它做什么,我会让 @bot 来实现!
信息来源:X:Lauren Tan (@poteto)
行业动态普通
微软盘点 Windows on Arm 进展:英伟达 RTX Spark 入局,多厂商秋季上线 Arm PC
微软发文回顾 Windows on Arm 一年进展,英伟达将于今年晚些时候凭借 RTX Spark SoC 加入该阵营,与高通骁龙 X 平台共同巩固平台前景。
信息来源:IT之家(RSS) · NVIDIA
产品发布 / 更新普通
英伟达 RTX Spark 新增支持《Apex 英雄》等 5 款游戏,原生支持 EA Javelin 反作弊系统
英伟达在科隆游戏展宣布,RTX Spark 在秋季上市前新增支持《EA SPORTS F1 25》《Apex 英雄》《纪元 117:罗马和平》《ARC Raiders》《最终决战》5 款游戏,并原生支持 EA Javelin 反作弊系统。
信息来源:IT之家(RSS) · NVIDIA
观点 / 方法普通
工具提示需要延迟,然后需要跳过它
FrontPrep 作者将工具提示延迟设为 0 导致光标扫过页面时提示瞬间弹出,统一加 200ms 延迟又让连续悬停多个 logo 时显得迟钝。解决方案是引入"预热窗口"机制:首次悬停等待 200ms 打开提示,关闭后启动 300ms 冷却计时器,期间悬停其他 logo 可立即打开提示且跳过动画,冷却结束后恢复 200ms 延迟。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法普通
Luma AI 新作《蓝色时刻》亮相
在蓝色时刻,一名杀手穿过大理石地板,去终结那份他从未想过质疑的契约。 "L'heure Bleue"由 Bryan Soegondo @DreamLabLA 创作,使用 Luma 制作。
信息来源:X:Luma AI (@LumaLabsAI)
观点 / 方法普通
SemiAnalysis 揭秘 OpenAI Jalapeño 芯片
SemiAnalysis 长文披露 OpenAI 自研 Jalapeño 芯片,称其面向数十万亿参数模型与百万级 token 上下文设计,并质疑 CUDA 在 AI 可自写代码优化新架构下的存续。该芯片以每瓦性能为核心,目标让数千芯片协同为单一推理机,其每兆瓦输出 token 吞吐已超越英伟达 Vera Rubin 公布数据。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI / NVIDIA
产品发布 / 更新普通
OpenAI 首款自研芯片 Jalapeño 性能首秀:DeepSeek R1 每瓦 AI 吞吐量是 GB300 的 1.7 倍
OpenAI 首款自研推理芯片 Jalapeño 性能首秀,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型测试中,每瓦 AI 吞吐量较 GB200 和 GB300 高出 1.5 至 1.9 倍,端到端延迟约为对比系统的 28% 至 59%。
信息来源:IT之家(RSS) · OpenAI / GPT / DeepSeek
产品发布 / 更新普通
NVIDIA 发布 Jetson Orin Nano 2 机器人计算机,双倍算力或四成节能
NVIDIA 推出面向入门级边缘 AI 的 Jetson Orin Nano 2 机器人计算机,预计 2027H1 以模组及开发套件形态上市。该产品采用与 Orin Nano Super 相同外形规格,AI 推理算力为前代 2 倍,标准模式下达 78 TOPS,集成 8 核 Arm CPU 和 8GB 内存;若性能控制在前代水平,功耗仅 15W,为前代的 60%。
信息来源:IT之家(RSS) · NVIDIA
论文研究普通
评测框架无中立:同一模型得分31%到89%
新论文揭示评测框架(harness)对模型得分影响巨大:12个开源模型在26种同等合理的配置下回答相同3,679道题,仅改变选项顺序、提示词措辞和答案读取方式,gemma4-31b得分即可从31%波动至89%。配置敏感题目承载了相邻模型间95.7%的差距,4个模型在某种配置下可排第一。基准压缩方法筛选的题目恰是最易受配置影响的,压缩基准实则在挑选脆弱项。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
模型发布 / 更新普通
曝 OpenAI 已预训练 Bel 模型:超 10T 参数,冲击通用人工智能
消息源 @synthwavedd 爆料称,OpenAI 已完成下一代模型 Bel 的预训练,该模型是 Doug 的直接继任者,总参数超过 10T,并计划将其打造为 GPT-6 之后的基座模型,甚至冲击 AGI 阈值。消息源认为,这些探索可能让 Anthropic 感到压力,OpenAI 认为面对即将发布的 Astra,Anthropic 没有拿得出手的应对方案,主要受算力条件所限。
信息来源:IT之家(RSS) · OpenAI / GPT / Claude
论文研究普通
无中立基准:配置变化致模型排名大幅波动
一项研究让12个开源权重模型在26种同等合理的基准配置下回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题,仅改变选项顺序、提示词措辞及答案读取方式。gemma4-31b的得分随配置在31%至89%间波动,四个模型在某种配置下排名第一。配置敏感题目承载了相邻模型间95.7%的差距,基准压缩方法筛选出的题目恰是最易受配置影响的。
信息来源:X:DAIR.AI (@dair_ai)
产品发布 / 更新普通
Anthropic 更新 Claude 记忆机制,打通 Cowork 与聊天的记忆功能
Anthropic 宣布更新 Claude Cowork 与聊天功能之间的记忆机制,将两个系统的记忆功能打通,实现统一管理。Cowork 在云端执行任务时可访问 Claude 从聊天记录中记住的信息,反之亦然。涉及健康状况、个人信念等敏感话题的记忆默认关闭,但用户可在"记忆"设置中手动开启;Free、Pro 和 Max 套餐默认开启记忆功能,Mac 和 iOS 平台同样支持。
信息来源:IT之家(RSS) · Claude
观点 / 方法普通
传闻称OpenAI与Anthropic新模型能力飞跃
Kim援引多方消息称,OpenAI与Anthropic尚未发布的模型能力将实现全面显著跃升,传闻还称上下文与记忆问题已被"解决",并出现可持续学习的自我改进模型。引用推文称未来8个月内或将再现o3到fable级别的能力跨越。作者强调这些仅为传闻,无实证,但来源日益频繁且包括可靠人士。
信息来源:X:Kim (@kimmonismus) · OpenAI / Claude