AI 情报文章归档
浏览 AI圈报 已保存的 5825 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5825
正式分类6
精选内容3375
全部文章
第 49 / 146 页 · 每页 40 条
观点 / 方法普通
Ox Alpha 三天处理 11.6T tokens,创 OpenRouter 纪录
Ox Alpha 三天内处理 11.6T tokens,是 OpenRouter 此前最大模型发布量的 2.6 倍,且有望今日突破 6T tokens。该模型拥有 1.05M-token 上下文窗口,专为持续智能体工作设计,单次会话可承载远超普通聊天的文本量。这种规模得益于编码智能体在单任务中通过长上下文、重试和重复工具调用大幅放大 token 消耗。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
Luma Dream Lab 周报首期:创意专业人士的每周探索
/Dream Lab 周报/ 第 1 期 本系列展示我们的创意专业人士及其每周将 Luma 打造为全球最佳创意工具的探索历程。
信息来源:X:Luma AI (@LumaLabsAI)
观点 / 方法普通
BestBlogs 早报 08-25:AI Coding 转向环境与验证驱动、Agent 治理、AI 工程技能图谱、NVIDIA Groq 3 LPX、GPT-5.6 集成 Kiro
大淘宝技术提出 AI Coding 应从 Spec 驱动转向环境与验证驱动,内部案例改码仅 1 小时但上线耗时 3 周。Steve Yegge 主张用可执行治理系统"围栏"管理约 50-60 个 Agent;吴恩达详解 AI 工程六类能力。
信息来源:X:洪明 (@hongming731) · GPT / NVIDIA
教程 / 实战普通
早报:AI Coding 后,团队如何重建验证与治理
今日早报聚焦 AI 编码后的交付瓶颈:生码仅占研发链路 20-30%,需将构建、测试、日志等环节改造为 Agent 可调用的闭环。Steve Yegge 在约 50-60 个 Agent 的软件工厂中,用 450 条法律式构件建立"围栏"治理系统。吴恩达则拆解 AI 工程六类能力,强调基于评估的开发与数据、运维协同。
信息来源:X:洪明 (@hongming731)
行业动态普通
险些崩盘的AI对冲基金Situational Awareness正遭SEC调查
由OpenAI校友Leopold Aschenbrenner领导的AI对冲基金Situational Awareness正被美国证券交易委员会(SEC)调查。据《纽约时报》报道,SEC已向其交易和融资银行发出传票,要求"保留相关信息",但该基金尚未被指控任何不当行为。该公司在7月底AI股下跌中损失数十亿美元,其表示将"全力配合任何监管要求"。
信息来源:TechCrunch:AI(RSS) · OpenAI
产品发布 / 更新普通
微软 AI 智能体系统 Aion 曝光:以 Copilot 为核心、重塑桌面体验
微软 Project Aion(内部名 CopilotOS)曝光,定位为面向企业、没有开始菜单的 AI 系统,可在运行 AOSP、Win3 或 Windows 11 的 AI 专用设备上运行。
信息来源:IT之家(RSS)
观点 / 方法普通
老板们要求员工将工作信息从私密 Slack 私信移至公开频道,以便 AI 智能体读取使用
许多老板要求员工将有用工作信息从私密 Slack 私信移至公开公司频道,以便 AI 智能体读取并用于工作。WSJ 报道,若员工私下讨论客户不满原因,AI 智能体可能永远看不到该背景;在可搜索频道讨论则可用于准备客户简报或总结决策。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
wikiHow 起诉 OpenAI 盗用文章训练 GPT
wikiHow 起诉 OpenAI,指控其未经许可抓取超 1.1 万篇文章训练 GPT 模型,侵犯至少 1200 项注册版权。诉讼还称 ChatGPT 的回答可替代 wikiHow 页面,将争议从训练延伸至市场替代。案件于 8 月 21 日在纽约南区法院提起,仍处诉状阶段;OpenAI 主张合理使用,且美国法律不保护文章中的程序与方法,为其提供潜在抗辩。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI / ChatGPT / GPT
观点 / 方法普通
中国网络上一部分人坚称唐朝从未存在过
中国互联网上一小部分声音坚称唐朝(公元618年至907年)从未存在过,这一说法源于历史网红"乔宇"5月发布的视频,其用占星数据"证明"唐朝不存在。该话题在微博上已有数千万浏览量,甚至有人致电西安旅游局要求关闭景点。官媒《人民日报》发文称该说法"荒谬",并警告历史虚无主义将削弱文化自信。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态普通
马斯克:SpaceX 计划明年第四季度发射搭载英伟达芯片的 AI 卫星
马斯克表示,SpaceX 首批搭载英伟达芯片的 AI 卫星将于明年第四季度首次发射,并于 2028 年实现大规模部署。SpaceX 与英伟达合作设计了针对太空环境优化的 Vera Rubin NVL72 系统,每个轨道数据中心将比传统计算机机架更简单、便宜、高密度且轻量化。SpaceX 已向 FCC 申请部署最多 100 万颗卫星的星座,并选定英伟达作为独家技术供应商。
信息来源:IT之家(RSS) · NVIDIA
产品发布 / 更新普通
AgentX:InferenceX 新智能体推理基准
推出 AgentX:InferenceX 新的智能体推理性能基准。(1/2)🧵
信息来源:X:SemiAnalysis (@SemiAnalysis_)
论文研究普通
Best Practice Critic Optimization:一种稳定的基于评论家的强化学习训练方案
BPCO 提出一种结合 DPPO、奖励范围限定的价值预测、蒙特卡洛价值目标、未归一化策略优势及长度自适应广义优势估计的训练方案,以解决基于评论家的强化学习训练不稳定的问题。在 1.5B 至 30B-A3B 混合专家模型的数学推理任务中,BPCO 一致优于强评论家基线,并在每个提示仅采样一个响应的情况下达到或超过基于组采样的基线。该方案同样适用于基于评分标准的奖励学习,代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
FrontierChallenge:评估科学智能体端到端工作流完成度的新基准
FrontierChallenge 是一个跨领域科学工作流基准,包含 300 个端到端任务,论文发布并评估其中 97 个,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学及电化学/环境领域。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
评估许可究竟意味着什么?Inspect Evals 提交级快照中的声明相对推理普查
一项针对 Inspect Evals 全部 124 个评估单元的普查显示,其中 110 个因缺乏所需历史证据或语义基础而无法进行确定性推理。该审计通过冻结基底、基础族与声明查询的形式化框架,对评估声明与指标之间的许可关系进行了分类,输出类型化停止点、不稳定见证与稳定子结构,而非单一的稳健性标签。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
教程 / 实战精选
如何在编辑器里实时挑选最佳 AI 模型
OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。判断标准是"每完成任务的成本"而非"每 token 成本"。其 MCP 服务器可直接在 Claude Code、Cursor 等编辑器中查询实时排名、价格和基准,并用 openrouter/auto-beta 按请求路由。
信息来源:OpenRouter:Announcements(RSS) · Claude / Cursor
论文研究普通
LibriBrain100:百小时宽深 MEG 数据集,推动神经语音解码规模化
LibriBrain100 发布,将原有 MEG 语音解码数据集规模扩大一倍以上,提供超 100 小时自然连续语音聆听数据。其中单被试 80 小时数据创下深度内被试神经数据新纪录,为同类数据集的 8 倍;基于现有解码模型,该数据集在词分类基准上取得 SOTA 表现。数据集附带标准划分、开源 Python 库及公开排行榜竞赛,旨在加速非侵入式脑机接口研究。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新普通
OpenAI 推出 ChatGPT Work 和 Codex 的 Admin 插件
OpenAI 为 ChatGPT Work 和 Codex 推出 Admin 插件,让管理员在单一对话中完成查看工作区活动、管理成员与权限、调整用量限制及审批支出请求等操作。该插件遵循用户现有角色和权限,不扩大访问范围,并可将待处理的用量请求路由至 Slack 或 Microsoft Teams 审批。OpenAI IT 团队部署的工作流已解决约 45% 的工单量。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
论文研究普通
Game2World Engine:解锁野外游戏视频用于世界模型训练
研究团队提出全栈框架G2WEngine,自动提取并合成UI覆盖层,构建含96K合成视频和1,079段野外片段的Game2World数据集。基于该数据训练的GameCleaner模型在UI去除任务上平均AAR达95.36,较最强时序掩码基线提升57.3%;使用去UI数据训练的世界模型VideoReward提升6.83%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
D^3-MOPD:面向高效多教师蒸馏的自适应动态域调度
D^3-MOPD 提出一种零开销调度器,利用训练中已有的逐域反向 KL 信号在线调整数据混合比例,解决固定混合在域收敛速率差异下的算力浪费问题。在 Qwen3.6-35B-A3B 学生模型从四个域专家教师蒸馏的实验中,该方法将平均学生-教师性能差距缩小 97%(vanilla MOPD 为 63%),以约 3 倍更少的 rollout 步骤达到相同峰值性能,并在七项基准中三项超越专家教师。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
MemUse:将长期人机对话中的记忆评估从直接问答转向自然融入
一项为期4个月、涉及40名用户和1,872次会话的部署研究发现,现有记忆基准的Direct QA准确率在7种条件下介于19.7%至70.1%之间,但与用户满意度无关。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CAFE:自我改进的搜索智能体需要共同进化的反馈
CAFE(Coupled Agent--Feedback Evolution)提出一种共享参数模型交替扮演搜索智能体与评论家的框架,通过在线RL与离线偏好优化耦合,让反馈随策略共同进化。在七个智能体搜索基准上,CAFE平均优于所评估的基于RL的搜索智能体,在全部六个域外基准上保持收益,并减少答案级幻觉。消融实验表明,仅改进智能体或仅改进评论家最终会陷入平台期,而交替更新两者可持续提升性能。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MoTE:面向多任务视频理解的任务专家混合解码器架构
论文提出MoTE(Mixture of Task Experts)解码器架构,将大语言模型的前馈网络转换为任务特定专家,同时共享多模态主干网络。实例化模型VideoLLM-MoTE在五个COIN基准上采用显式任务路由,五专家模型每样本激活约2B LLM参数,平均top-1准确率超过近期VideoLLM基线,并优于密集全专家激活与学习式稀疏路由。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
OPDVR:无需额外超参数的无监督策略蒸馏与可验证奖励结合方法
研究者提出 On-policy Distillation with Verifiable Reward(OPDVR),将基于可验证奖励的强化学习(RLVR)与在线策略蒸馏(OPD)无缝结合,无需引入任何额外超参数。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Recuris:面向长时程智能体的递归经验-工作记忆演化架构
Recuris 提出递归经验-工作记忆架构,让工作记忆跟踪任务进度并引导技能选择,将执行转化为结构化证据,由固定元智能体对技能记忆进行局部验证更新,形成有界递归演化循环。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Luce:面向3D资产生成的可重打光高斯表示
Luce提出一种将几何与PBR材质统一到体素化多模态高斯云中的3D表示,通过变分自编码器压缩至统一潜在空间,再由修正流Transformer从单张图像生成。在Toys4K上,Luce实现SOTA单图转3D生成,FID较最强基线提升28%;在AI生成图像基准上,CLIP图像对齐分数达0.8519,优于基线0.8299。Luce可生成保留文字、标志等细节的可重打光资产。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Meta^n:通过涌现深度实现递归自我改进
Meta^n 提出一种固定元操作 Ω 并对其输入递归的自我改进方法,将元深度从约两层扩展至由收敛决定的动态深度。在两种骨干模型上,Meta^n 在全部八个基准家族上超越此前自我改进智能体,其中在 ARC-AGI-2 上唯一取得非零分数。消融实验显示,递归收益主要来自各层传递给下一层的条件,且深度增加时会涌现出不同层角色。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
当"必须"变成"也许":LLM 智能体工作流中的约束弱化
一项针对 LLM 智能体工作流的研究发现,交接转换会反复将"必须解决"的约束弱化为"仅供参考"的非约束信息。在 1,296 个受控合成场景中,正常交接压缩导致 100.0% 的约束失效和 54.2% 的违规动作;恢复全部四个状态字段可将约束保持率提升至 100.0%,违规动作降至 0.0%。下游验证虽能消除违规动作,但约束失效仍达 95.3%,表明语义可用性并不保证操作层面的状态保持。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
STARFlow2:用归一化流桥接语言模型,实现统一多模态生成
STARFlow2 提出将自回归归一化流与语言模型统一,用于多模态生成。该方法观察到自回归归一化流与 LLM 共享因果掩码、KV-cache 机制和从左到右结构,从而弥合文本与图像生成的架构差异,避免离散 token 化带来的视觉保真度损失。
信息来源:Apple Machine Learning Research(RSS)
行业动态普通
OpenAI 封禁俄罗斯虚假影响力行动账号
OpenAI 封禁了一批源自俄罗斯的账号,这些账号利用 AI 推广一个虚构的以色列智库及"主权"指数,内容赞扬俄罗斯并批评西方。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
产品发布 / 更新普通
TorchMorph:CUDA 加速的形态学变换库
TorchMorph 是一个轻量级 PyTorch 扩展,提供 22 个公开算子,覆盖二值/灰度形态学、精确与近似距离变换及熵正则化最优传输,全部以融合 CUDA 内核实现,支持最多八维空间张量。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
DiffusionOPSD:扩散模型的在线策略自蒸馏框架
DiffusionOPSD 提出一种在线策略自蒸馏框架,将图像级奖励引导转化为采样查询点上干净输出预测的显式目标。在 SD 3.5-M 和 Z-Image-Turbo 上,该方法在 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,相比最强竞争方法最高提升 44.0%,训练 GPU 小时数较 DiffusionNFT 分别减少 40% 和 63%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Gated Recurrent Transformer:用循环调制在 Transformer 中实现表达性深度
Gated Recurrent Transformer 提出一种循环深度 Transformer,以固定深度前奏与尾声块包裹单一共享核心并迭代 R 次,通过轻量投影和逐元素更新门调制循环更新。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从看见到行动:智能眼镜如何成为第一人称智能平台
一篇系统综述首次以统一框架研究智能眼镜,将其定位为连接人类感知、持久上下文与数字或物理行动的第一人称智能平台。文章沿八项可验证硬件能力轴刻画设备,围绕七项基础能力组织文献,并提出L0-L5分级框架,涵盖采集、反应式感知、上下文辅助、持久状态、受控行动与具身耦合。综述还给出九维部署框架、基于主张的评估协议及证据阶梯,覆盖九个应用场景。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
教程 / 实战精选
GPT 5.6 折扣与杰文斯悖论:OpenRouter 数据揭示 Terra/Luna 降价如何引爆 token 用量
OpenRouter 数据显示,OpenAI 对 Terra 和 Luna 模型的大幅折扣使日均 token 用量分别飙升 5.6 倍和 13.8 倍,而未降价的 Sol 仅增长 1.1 倍。
信息来源:OpenRouter:Announcements(RSS) · OpenAI / GPT
论文研究普通
PonderPounce:将预训练 MLLM 用作机器人控制的场景上下文引擎
PonderPounce 将多模态大语言模型的原生因果上下文直接复用为机器人记忆,由 System2 模型 Ponder 积累场景观测与演示并生成子目标文本,System1 模型 Pounce 通过异步接口仅接收最新认知 token 及其年龄,两者端到端联合训练,无需专用记忆模块或桥接预训练。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LAION-BVD:面向多模态预训练的千万小时级开放视频数据集
LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
教程 / 实战精选
OpenRouter 视频生成 API:一份代码优先的接入指南
OpenRouter 推出统一的异步视频生成 API,通过 POST /api/v1/videos 提交任务、轮询状态并下载 MP4,支持 Seedance、Veo、Wan 等模型,切换模型只需更改 model 标识符。
信息来源:OpenRouter:Announcements(RSS)
论文研究普通
The Handoff Tax:LLM 智能体延续非原生轨迹的代价
研究用 Claude 与 GPT 家族的 LC/HC 模型配对,考察编码智能体在模型间切换时"交接税"的影响。完整轨迹升级仅能弥补不到一半的 LC 到 HC 质量差距,且成本显著增加;降级切换则性价比更优。交接方向还会改变最优接口选择:减少 LC 轨迹信息可提升升级质量,而移除 HC 轨迹会降低降级质量。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Claude / Hugging Face
论文研究普通
WarpSAC:重新思考探索与利用,迈向可扩展离策略强化学习新高度
WarpSAC提出一套数据体制感知的离策略强化学习算法族,通过受控实验揭示参数归一化、裁剪双Q等稳定器在不同数据规模下的适用性。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
GameWAM:面向视频游戏的 World Action Model
GameWAM 首次将 World-Action Model 引入原生闭环游戏玩法与 GUI 控制,通过并行视觉与动作生成、块因果条件及流匹配,联合预测未来视觉观测与可执行的键鼠轨迹。实验显示其以更少的原生动作数达到与对比智能体相当的任务成功率,并揭示了生成式控制中低频动作源成分系统性影响相机粗粒度运动的 LASI 失效模式。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face