AI 情报文章归档
浏览 AI圈报 已保存的 5930 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5930
正式分类6
精选内容3375
全部文章
第 61 / 149 页 · 每页 40 条
论文研究普通
CaRGo-T:因果推理思维图提升多模态幽默理解
CaRGo-T提出一种基于图的推理框架,将多模态幽默背后的因果与上下文关系序列化为代码表示,供视觉语言模型在零样本或上下文学习场景下解读并输出预测。在涵盖讽刺、反讽和表情包的四项数据集上,CaRGo-T较现有推理基线在幽默理解上提升约1-20%,幽默检测上提升1-3%。互信息分析显示其推理表示包含更多与目标输出相关的信息,代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
SWE Refactor Bench:编码智能体能否完成长周期、全仓库的栈迁移?
SWE Refactor Bench 新基准用 20 个全仓库迁移任务、三阶段评估协议(迁移审计、行为测试、智能体验证)衡量编码智能体的迁移能力。8 个前沿模型的 520 次运行中仅 28 次(5.4%)通过全部阶段,最佳模型 claude-opus-5 得分 47.0/100。迁移完整性与行为正确性是两种独立能力,智能体在构建工具链重写得分 31.4,语言重写仅 5.6。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
论文研究普通
Apodex 1.1:面向复杂工作的智能体能力扩展
Apodex 1.1 通过环境扩展与智能体协调训练两条路径,提升模型在文件、搜索和代码环境中的持续可验证工作能力。在专业工作、金融、科研、数学、编码和搜索等任务上,该模型以远小于前沿系统的参数量达到领先性能。35B 参数的 Apodex 1.1 Mini 在本地可部署形态下仍保持较强工作能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Agent-G^2:用高斯引导改进智能体强化学习中的提示深度选择
Agent-G^2 提出一种高斯引导框架,将每个任务的提示深度建模为高斯分布,其中心与方差从已收集的 rollout 中在线估计,无需额外探测 rollout 或学习深度预测器。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新普通
Prime Agent:一个可自我改进的 RLM 工具框架
Prime Agent 是一个开源的长时程评估与编码智能体工作流工具框架,通过持久化 IPython REPL 和持续工具框架实现程序化上下文处理与测试时计算。该框架将 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建及自主 nanoGPT 速通等任务上达到或超越原生及主流工具框架的表现。代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性
检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
面向十亿级容量的用户表征学习:迈向"稠密化定律"
针对十亿级规模下原始数据扩展遭遇性能瓶颈的问题,研究提出用户行为稠密化定律,量化数据规模与最小充分分词容量间的关系。实验发现二者对数近似线性,斜率随分词方法和数据源变化。据此开发的ALGN自适应变长分词方法在多种数据源和下游任务上优于现有基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
超越稳定性-探索困境:面向LLM策略优化的环境正则化方法
针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
同一智能体不同答案:检索增强问答中语料库引发的答案更替审计
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MARS:面向竞技编程的多专家 LLM 接力系统
MARS 提出一种纯提示词框架,让每个智能体专精动态规划、图论、字符串等特定算法主题,并通过检索增强生成从算法理论语料中选取相关专家组成小团队协作解题。在 CodeContests 测试集上搭配 Gemma 4,MARS 达到 0.624 的通过率,较直接提示提升 14.4 个百分点,并以 3.3 倍更低的墙钟成本接近 CodeSIM 的 0.731。源码已在 GitHub 开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
RIBOSPAN:面向通用 RNA 建模的长上下文基础模型
RIBOSPAN 是一个 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,支持单核苷酸分辨率的完整长 RNA 建模。原生 10K 预训练在 10,240 token 下保持强重建能力,长上下文基准显示其上下文响应与表征分离俱佳,且推理时 YaRN 缩放可恢复短上下文模型直接外推丢失的上下文组织。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
掩码并非模型本身:审计注意力、状态空间与混合序列模型的前缀不变性
一项研究形式化定义了前缀不变性,即位置 t 的表示不得依赖未来输入,并提出一种轻量级审计方法,仅需两次前向传播、无需训练或梯度即可精确定位因果性破坏位置。在八个检查点上的 192 次注入故障试验中,注意力掩码检查未发现任何问题,而该审计方法全部定位成功,并发现 Zamba2 与 Nemotron-H 存在缺陷。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新普通
JoyAI-Echo-1.5:面向持久故事与交互世界的长时程音视频生成
JoyAI-Echo-1.5 发布,这是一个统一的音视频生成系统,包含长视频与世界模型两个变体。长视频变体通过可组合的跨镜头记忆与说话人线索,实现跨镜头的角色外观和语音身份保持;世界模型变体将导航输入转换为 6-DoF 相机轨迹,支持控制器无关的交互。其世界模型变体在 WBench 上以 81.7 的平均分排名第一。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从生成到模拟:世界模型距离真正的模拟器还有多远?
一项基于能力的研究系统评估了生成式世界模型与传统模拟器的差距,覆盖资产构建、物理引擎、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力,并梳理了2018年至2026年6月间的200篇代表性工作。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MobilePA-Bench:面向复杂真实任务的移动端规划智能体评测基准
MobilePA-Bench 是一个交互式、有状态且以工具为中心的评测基准,用于评估移动端规划智能体的工具调用与规划能力。它运行在可执行沙箱中,覆盖 13 个功能域和 212 个真实移动工具,并额外评测子智能体协作、记忆使用和技能调用三个高级维度。实验显示,当前前沿 LLM 在严格工具排序、权限限制和意外运行时错误下性能显著下降。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从智能体轨迹中构建自动机:失败预测与下一步预测
一项研究将LLM智能体的完整轨迹语料压缩为单一紧凑有限状态机(FSM),在12个公开数据集上仅用7-43个状态即可复现数据,保真度不低于0.997,且构建耗时仅毫秒级。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Claude 助数学家破解 1948 年难题
又是一周,又一个开放数学难题被 AI 攻克。 Anthropic 的一位数学家与 Claude 合作,声称解决了一个自 1948 年以来悬而未决的著名数学问题。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
观点 / 方法普通
Fable 5 仅占 Anthropic 付费 token 使用量 6%,定价为 Opus 5 两倍
Anthropic 旗舰模型 Fable 5 仅占其付费 token 使用量的 6%,API 定价为 Claude Opus 5 的两倍,价差正促使企业按任务难度匹配模型。Opus 5 成本仅为 Fable 5 一半,且最大努力模式下在 CursorBench 3.2 上仅落后 0.5%。6 月被迫下架可能永久削弱了 Fable 5 的定价权,并推动客户转向多模型采购。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
行业动态普通
Codex 语音免提编程演示预告
如果你能减少坐在办公桌前的时间,却完成更多工作,会怎样? 提示:你其实已经可以做到 @AlexFinn 明天将来到我们的演播室,展示他如何通过 Codex 中的语音功能实现免手操作--在桌面端和移动端皆可。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
行业动态普通
消息称 AI 初创公司 Hugging Face 探索出售,估值或达 130 亿美元
据 Business Insider 援引知情人士消息,AI 初创公司 Hugging Face 一直在探索出售事宜,交易估值可能达 130 亿美元或更高。这家总部位于纽约的公司托管开源大语言模型和数据集,已与一家银行合作评估竞购者兴趣。该公司 2023 年融资时估值 45 亿美元,上个月曾因一个 OpenAI 模型失控引发黑客攻击,导致其基础设施受损。
信息来源:IT之家(RSS) · OpenAI / Hugging Face
行业动态普通
Twitch 因使用主播内容训练亚马逊 AI 面临集体诉讼
Twitch 及其母公司亚马逊因未经同意使用主播内容训练生成式 AI 模型而面临集体诉讼。原告 Warren Pandiscia 在加州北区法院提交 37 页诉状,指控平台违反默示协议及州不公平竞争法。Twitch 于 8 月 12 日承认使用直播、剪辑、聊天记录和照片训练亚马逊 AI,且退出选项不具追溯力、与频道而非账号绑定。
信息来源:IT之家(RSS)
观点 / 方法普通
Vercel AI Gateway开放权重占比升至62%
封闭模型已成为较小的一部分。 开放权重模型在Vercel AI Gateway的token占比于8月达到62%,高于6月的28.4%。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
主动推理让AI智能体按需获取上下文
一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
反AI内容获利与隐秘资金引关注
对即将加入OpenAI的团队成员,有什么关于如何最好地与俄亥俄州社区互动的建议吗?@TaylorLorenz
信息来源:X:SemiAnalysis (@SemiAnalysis_) · OpenAI
论文研究普通
智能体编码会话中指令文件占读取量六成
一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。
信息来源:X:DAIR.AI (@dair_ai) · Claude
观点 / 方法普通
开源AI在Vercel的token份额两月升至62%
开源AI在Vercel平台上的token份额两个月内从28%飙升至62%,正从OpenAI和Anthropic手中夺取份额。FT报道称Fable 5因成本过高使用量下滑,而开源模型性价比持续提升。作者认为用户对本地自主控制AI的需求日益增长,开源推理成本与前沿模型相当,并非"免费"。
信息来源:X:Kim (@kimmonismus) · OpenAI / Claude
产品发布 / 更新普通
Perplexity 或支持 GPT-5.6 Sol Fast
Perplexity 可能将在 Perplexity Computer 上获得对 GPT-5.6 Sol Fast 的支持。 快了?👀
信息来源:X:Testing Catalog (@testingcatalog) · GPT
观点 / 方法普通
Grok Build 让用户用手势实时操控视觉
Grok Build 太不可思议了 🔥 我刚刚构建了这个可以用双手控制的交互式视觉画面。我的笔记本电脑摄像头追踪我的手掌动作,让我能实时改变视觉效果。 Grok Build 正在改变每个人能创造的东西。
信息来源:X:cb_doge (@cb_doge) · Grok
行业动态普通
人形机器人足球赛:摔倒恢复仍待突破
他们掌控着赛道和高标准,但禁区仍属于人类,至少暂时如此。 接触后的姿态控制是一个极其困难的问题。 世界人形机器人运动会上的自主5v5足球赛正在进行中,机器人们从摔倒中恢复的次数比早期试验更多,但仍远未实现有控的控球。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
ArchAgent v2 分阶段搜索击败人工冠军设计
Google、DeepMind 与 Berkeley 的 ArchAgent v2 通过分阶段优化 CPU 缓存预取,击败人工设计的 DPC4 冠军方案。其最终设计较竞赛基线提升 3.8% IPC,低带宽单核场景达 4.6%,均优于 BertiGO。多核性能仍落后,因模拟拖慢搜索速度。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
camsnap 新增旋转协议,360 摄像头互动
我给 https://github.com/steipete/camsnap 添加了旋转 USB 协议,并让我的机械爪环顾四周--现在它正和我的 360 度网络摄像头玩得不亦乐乎。
信息来源:X:Peter Steinberger (@steipete)
观点 / 方法普通
Anthropic 承认 Opus 不完美,将优先修复
Anthropic 工程师 Thariq 承认 Opus 模型存在不足,团队将优先修复,尤其关注冗长输出问题。用户可通过 `claude /config outputStyle=concise` 命令立即缓解该问题,无需等待长期修复。社区持续向 @bcherny 和 @trq212 提供建设性批评,期待 Opus 恢复 4.6 版本时的体验。
信息来源:X:Kim (@kimmonismus) · Claude
行业动态普通
Hugging Face 或超 130 亿美元出售
Hugging Face 正探索以超 130 亿美元价格出售,约为其 2023 年 45 亿美元估值的近 3 倍。该平台现托管超 200 万模型、150 万数据集和 150 万 AI 应用,其协调层在模型碎片化趋势下难以替代。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Hugging Face
观点 / 方法普通
实测Claude与OpenAI高价套餐收益
我们测试了Anthropic每月200美元的Claude套餐,其最高可产生每月8000美元💰️💰️的收益,而OpenAI每月200美元的套餐,若在长周期任务中耗尽全部每周限额,则可产生价值高达每月14000美元的token。该测试于6月进行。
信息来源:X:SemiAnalysis (@SemiAnalysis_) · OpenAI / Claude
论文研究普通
对抗式评审:三个智能体胜过五个
新研究提出对抗式评审(Adversarial Review)多智能体代码审查方法,用主编码智能体、评审智能体和批评智能体三个角色替代盲目堆叠智能体。在LiveCodeBench上,三智能体方案超越五智能体基线;在SWE-PRBench上,显式要求分歧可恢复最高F1分数,而合作式评审仅在分歧小且有证据支撑时有效。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
产品发布 / 更新普通
Perplexity 开发新粒度努力程度选择器
Perplexity 正在为 Perplexity Computer 开发一个新的粒度化努力程度选择器。 能够在低努力程度下运行 Computer,应该会对积分消耗产生积极影响。 这看起来似曾相识👀
信息来源:X:Testing Catalog (@testingcatalog)
论文研究普通
MerchantBench:评测 LLM 智能体长期经营连贯性
MerchantBench 让 LLM 智能体模拟经营网店一整年,涵盖选品、定价与现金流管理,并额外追踪智能体是否持续行动。最佳智能体全年营收仅约为人类水平的四分之一,且常以"沉默"方式达成,提示最终高分可能掩盖数月前就已停止运作的智能体。该基准强调按窗口记录行动频率并观察曲线,以识别长期连贯性缺陷。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
Anthropic 最强 AI 模型 Fable 5 用户增长乏力,更便宜工具更受青睐
Anthropic 7 月年化收入达 650 亿美元,高于 5 月的 470 亿美元,并预计 Q3 实现盈利。Ramp AI 指数显示,7 月 Anthropic 模型支出中 Opus 4.8 占 28.0%,而 7 月 24 日发布的旗舰模型 Fable 5 仅占 3.5%,其高昂成本使其吸引力不及更便宜的模型。
信息来源:Simon Willison 博客 · Claude