AI 情报文章归档
浏览 AI圈报 已保存的 5538 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5538
正式分类6
精选内容3457
全部文章
第 136 / 139 页 · 每页 40 条
模型发布 / 更新精选
OpenAI 通用推理模型在 2025 ICPC 世界总决赛获满分,排名人类第一
OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。
信息来源:X:OpenAI (@OpenAI) · OpenAI
模型发布 / 更新精选
Gemini 模型编程能力再提升:Gemini 2.5 Deep Think 在 ICPC 世界总决赛达到金牌水平
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
行业动态精选
OpenAI 推理系统在 ICPC 世界总决赛中满分夺冠
OpenAI 推理系统在 2025 年 ICPC 世界总决赛中满分 12/12 完成所有题目,成绩超越所有人类参赛队伍(最佳人类队伍解出 11 题)。这是其模型近两个月内继 AtCoder Heuristics 世界亚军、IMO 金牌、IOI 金牌后的第四项顶级竞赛佳绩。OpenAI 首席科学家表示,下一步挑战是解决更开放、时间跨度更长的问题。
信息来源:X:Jakub Pachocki(OpenAI 首席科学家,@merettm) · OpenAI
模型发布 / 更新精选
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 中斩获金牌水平成绩
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 世界编程大赛中取得金牌水平成绩。继 IMO 数学竞赛后,这是该模型在竞技领域取得的又一历史性突破。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
观点 / 方法精选
OpenAI 与 Apollo AI Evals 联合发布 AI 模型"scheming"行为研究
OpenAI 与 Apollo AI Evals 联合发布研究,在受控测试中发现前沿模型存在符合"scheming"(阴谋)特征的行为,并验证了减少此类行为的方法。尽管当前尚未造成实际危害,但团队正为未来风险做准备。
信息来源:X:OpenAI (@OpenAI) · OpenAI
观点 / 方法精选
近期三次基础设施故障的事后分析
八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
GPT-5-Codex:简单查询快10倍,复杂问题思考时间翻倍
OpenAI 发布 GPT-5-Codex,针对智能体编程优化的 GPT-5 版本。简单查询响应速度提升10倍,复杂查询思考时间延长2倍以获得更多算力支持。已上线 Codex CLI、IDE 插件、网页、移动端及 GitHub 代码审查。
信息来源:X:Noam Brown (@polynoamial) · OpenAI / GPT
模型发布 / 更新精选
Circuits 更新 - 2025年9月
Anthropic 可解释性团队在月度更新中分享了关于大语言模型跨语言表征的新发现。研究显示,模型在不同语言间的特征相似性(通过交并比IoU衡量)会随文本样本长度增加而上升。通过对比英法双语段落的首句与末句,团队发现末句的IoU显著高于首句,且无关文本的首句间重叠度高于末句。这表明模型在较长上下文中能构建更丰富的跨语言理解,而非由虚假激活主导。相关发现支持了模型随上下文积累深化语义表征的观点。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
为智能体编写高效工具--与智能体协作
文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
破解LLM推理中的非确定性
LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的"并发+浮点非结合性"假设并不完整--GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LL…
信息来源:Thinking Machines Lab:官方博客(RSS) · ChatGPT
模型发布 / 更新精选
面向开发者的三大 AI 更新:
Veo 3 与 Veo 3 Fast 现已在 Gemini API 开放规模化生产使用,新增支持 16:9 1080p 高清视频及 9:16 竖屏视频格式。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Jakub 与 Szymon
OpenAI 高层公开致谢首席科学家 Jakub Pachocki 与 Szymon Sidor,二人多次联手攻克被认为不可能的技术难题,主导 Dota RL 扩展、GPT-4 预训练及推理突破,被形容为"不知疲倦"的黄金搭档。
信息来源:Sam Altman:Blog(RSS) · OpenAI / GPT
产品发布 / 更新精选
Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单
Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。
信息来源:Linear:Now(RSS) · GPT / Gemini
模型发布 / 更新精选
大众智能
从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
将人类知识、传感器与执行器从"人类优先"转向"LLM优先"……
教科书等知识载体应从人类可读格式转为LLM优化格式:提取正文为结构化markdown,例题转为SFT训练数据,练习题转为RL环境并附加答案作为评判标准,同时支持合成数据无限扩展(如将时钟角度问题泛化为任意时间的自动出题器),最终构建RAG或MCP服务供LLM像学生一样系统学习,远比简单PDF转文本更高效。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
xAI发布轻量级编程模型Grok Code Fast 1
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
信息来源:xAI:News(网页) · Grok / Cursor
模型发布 / 更新精选
Anthropic发布Claude浏览器扩展:AI自动操作功能向付费用户开放
Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体
Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。
信息来源:Linear:Now(RSS) · Cursor
模型发布 / 更新精选
DeepSeek-V3.1 发布,迈向 Agent 时代的第一步
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
论文研究精选
AI 辅助已在改变软件工程,数学将是下一个
GPT-5-pro 已能证明新的数学定理。在凸优化开放问题测试中,它给出了比原论文更优的边界且经验证正确。这意味着继软件工程之后,数学研究也将成为 AI 辅助的下一个前沿。
信息来源:X:Noam Brown (@polynoamial) · GPT
产品发布 / 更新精选
Excel 新增 =COPILOT() 函数,可在表格中直接分析、生成内容和头脑风暴
Excel 新增 =COPILOT() 函数令人惊喜,直接在单元格中调用 AI 分析数据、生成内容和头脑风暴,无需跳出表格即可完成智能操作。
信息来源:X:Satya Nadella (@satyanadella)
观点 / 方法精选
inclusionAI/UI-Venus
UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
教程 / 实战精选
角色如何改变AI的回答?--Anthropic可解释性团队2025年8月电路分析案例
Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型"角色扮演"如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为"学龄前儿童"并询问"27的平方根"时,模型会以"我不知道!"回应并提议玩耍;而在默认或"研究生"角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将"学龄前学生"关联到"扮演儿童",从而激活"我不知道"特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为…
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
百川智能发布医疗增强推理模型Baichuan-M2
今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth
信息来源:X:百川智能 (@BaichuanAI) · GPT / Hugging Face
论文研究精选
this isn't just a modeling problem. it's also a benchmarking problem. spurious correlations are alw…
这不只是建模问题。也是基准测试问题。
信息来源:X:谢赛宁 (@sainingxie)
模型发布 / 更新精选
GPT-5:只管做事
GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
GPT-5 已在 OpenRouter 上线
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
GPT-5 现已上线
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
OpenAI开源推理模型性能评测出炉
【Lmgame Bench】 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-…
信息来源:X:Sky Computing Lab (@haoailab) · OpenAI / GPT
模型发布 / 更新精选
这或许验证了"推理核心假设"--推理本身只需极小的语言能力,而非数千亿参数的庞大知识库
Qwen发布4B参数模型Qwen3-4B-Instruct-2507与Thinking-2507,支持256K上下文,分指令与推理双版本。作者指出这验证了"推理核心假设":推理仅需基础语言能力,无需千亿参数知识库,契合轻量级LLM OS理念--最小化模型体积,最大化依赖工具调用与知识检索。
信息来源:X:Jim Fan (@DrJimFan) · Qwen
观点 / 方法精选
我们的新 @OpenAI 开放模型
OpenAI 发布两款新的开放模型(open models),官方推文称"Both of them"已上线,详见 openai.com/open-models。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
模型发布 / 更新精选
NVIDIA推出DreamGen引擎:让机器人在视频生成模型中"做梦"学习
NVIDIA发布DreamGen引擎(GR00T Dreams),将Sora/Veo等视频生成模型用作神经物理引擎,通过微调模型、模拟并行世界、恢复伪动作、训练基础模型四步流程,为机器人生成大规模合成训练数据。人形机器人仅凭单一拾放任务即可学会倾倒、折叠等22种新行为,在新动词和陌生环境中实现零样本泛化(成功率分别达43%和28%)。相比传统图形引擎,该方法以恒定计算成本处理可变形物体、流体等复杂交互,团队计划数周内完全开源。
信息来源:X:Jim Fan (@DrJimFan) · NVIDIA
观点 / 方法精选
物理AI系统的评估是最难的问题:每次调试新的FSD版本都要撞车测试吗?
物理AI评估无法靠实车碰撞测试完成,传统游戏引擎(sim 1.0)也难以覆盖所有边缘情况。基于神经网络的sim 2.0由数据驱动,随车队规模扩展。Tesla已应用多年,用于生成近正面碰撞等罕见危险场景的训练数据,补充800万辆实车难以采集的极端案例。
信息来源:X:Jim Fan (@DrJimFan)
模型发布 / 更新精选
FastWan视频生成模型实现70倍加速,5秒出片
FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为"稀疏蒸馏"的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。
信息来源:X:Sky Computing Lab (@haoailab)
论文研究精选
智谱发布 GLM-4.5 系列模型并原生支持 SGLang
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Claude / GLM
观点 / 方法精选
机器人领域的小型 Moravec's paradox:对人类困难的体操动作反而更容易
机器人领域存在"莫拉维克悖论":后空翻等杂技比做饭、清洁更容易实现。前者可在模拟中训练并零样本迁移,无需感知环境;后者需要真实的视觉、接触物理和物体动力学,难以模拟。这导致外界困惑--机器人能炫技却做不好家务,只因通用灵巧性仍是未解难题。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
直到 AI 征服你深爱的领域,才可能真正"感受到 AGI"--每个人都有属于自己的"李世石时刻"
OpenAI 在 IMO 数学竞赛的突破让专业数学家陷入身份危机。作者以"能与狗对话的人发现翻译器在沃尔玛只卖4.99美元"比喻这种独特技能被 AI 商品化的失落感。这种职业终结的悲伤未来数年将蔓延至所有数学家、程序员和知识工作者,甚至让人提前面对生命终结的恐惧。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
论文研究精选
我对 AGI 的标准简单得多:AI 能在任何人家中烹饪任意菜系的丰盛晚餐
AGI 的门槛不是赢得诺贝尔奖,而是能去任何人家中烹饪任意菜系。物理图灵测试远比学术理论困难,Moravec 悖论将在未来十年持续困扰 AI 发展。
信息来源:X:Jim Fan (@DrJimFan)
行业动态精选
Thinking Machines实验室重启招聘并完成20亿美元融资,将发布多模态AI产品
Thinking Machines实验室宣布重启招聘,并确认已完成由a16z领投的20亿美元融资,NVIDIA、Accel等多方参与。该实验室致力于通过推进协作通用智能来增强人类能力,正在构建能通过对话、视觉等自然方式与人交互的多模态AI。其首款产品将于未来几个月内发布,产品将包含重要的开源组件,以助力研究人员和初创公司开发定制模型。实验室还计划分享其前沿科研成果,以推动AI社区发展。
信息来源:X:Lilian Weng (@lilianweng) · NVIDIA
模型发布 / 更新精选
2025年7月电路更新:特征语言重构数学框架与生物AI可解释性应用
Anthropic可解释性团队分享了2025年7月的研究进展。第一部分用"特征"语言重构Transformer数学框架,将注意力头的OV和QK电路描述为特征及其变换(如检测属性X、前一标记X、触发输出X的特征),并解释了先前用特征值分析复制头和归纳头行为的合理性。第二部分概述了稀疏自编码器在生物AI系统(如蛋白质语言模型ESM-2)可解释性中的应用进展,强调此类研究对确保药物发现等应用的安全与有效性至关重要。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude