AI 情报文章归档
浏览 AI圈报 已保存的 5566 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5566
正式分类6
精选内容3476
全部文章
第 137 / 140 页 · 每页 40 条
产品发布 / 更新精选
Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单
Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。
信息来源:Linear:Now(RSS) · GPT / Gemini
模型发布 / 更新精选
大众智能
从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
将人类知识、传感器与执行器从"人类优先"转向"LLM优先"……
教科书等知识载体应从人类可读格式转为LLM优化格式:提取正文为结构化markdown,例题转为SFT训练数据,练习题转为RL环境并附加答案作为评判标准,同时支持合成数据无限扩展(如将时钟角度问题泛化为任意时间的自动出题器),最终构建RAG或MCP服务供LLM像学生一样系统学习,远比简单PDF转文本更高效。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
xAI发布轻量级编程模型Grok Code Fast 1
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
信息来源:xAI:News(网页) · Grok / Cursor
模型发布 / 更新精选
Anthropic发布Claude浏览器扩展:AI自动操作功能向付费用户开放
Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体
Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。
信息来源:Linear:Now(RSS) · Cursor
模型发布 / 更新精选
DeepSeek-V3.1 发布,迈向 Agent 时代的第一步
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
论文研究精选
AI 辅助已在改变软件工程,数学将是下一个
GPT-5-pro 已能证明新的数学定理。在凸优化开放问题测试中,它给出了比原论文更优的边界且经验证正确。这意味着继软件工程之后,数学研究也将成为 AI 辅助的下一个前沿。
信息来源:X:Noam Brown (@polynoamial) · GPT
产品发布 / 更新精选
Excel 新增 =COPILOT() 函数,可在表格中直接分析、生成内容和头脑风暴
Excel 新增 =COPILOT() 函数令人惊喜,直接在单元格中调用 AI 分析数据、生成内容和头脑风暴,无需跳出表格即可完成智能操作。
信息来源:X:Satya Nadella (@satyanadella)
观点 / 方法精选
inclusionAI/UI-Venus
UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
教程 / 实战精选
角色如何改变AI的回答?--Anthropic可解释性团队2025年8月电路分析案例
Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型"角色扮演"如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为"学龄前儿童"并询问"27的平方根"时,模型会以"我不知道!"回应并提议玩耍;而在默认或"研究生"角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将"学龄前学生"关联到"扮演儿童",从而激活"我不知道"特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为…
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
百川智能发布医疗增强推理模型Baichuan-M2
今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth
信息来源:X:百川智能 (@BaichuanAI) · GPT / Hugging Face
论文研究精选
this isn't just a modeling problem. it's also a benchmarking problem. spurious correlations are alw…
这不只是建模问题。也是基准测试问题。
信息来源:X:谢赛宁 (@sainingxie)
模型发布 / 更新精选
GPT-5:只管做事
GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
GPT-5 已在 OpenRouter 上线
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
GPT-5 现已上线
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
OpenAI开源推理模型性能评测出炉
【Lmgame Bench】 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-…
信息来源:X:Sky Computing Lab (@haoailab) · OpenAI / GPT
模型发布 / 更新精选
这或许验证了"推理核心假设"--推理本身只需极小的语言能力,而非数千亿参数的庞大知识库
Qwen发布4B参数模型Qwen3-4B-Instruct-2507与Thinking-2507,支持256K上下文,分指令与推理双版本。作者指出这验证了"推理核心假设":推理仅需基础语言能力,无需千亿参数知识库,契合轻量级LLM OS理念--最小化模型体积,最大化依赖工具调用与知识检索。
信息来源:X:Jim Fan (@DrJimFan) · Qwen
观点 / 方法精选
我们的新 @OpenAI 开放模型
OpenAI 发布两款新的开放模型(open models),官方推文称"Both of them"已上线,详见 openai.com/open-models。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
模型发布 / 更新精选
NVIDIA推出DreamGen引擎:让机器人在视频生成模型中"做梦"学习
NVIDIA发布DreamGen引擎(GR00T Dreams),将Sora/Veo等视频生成模型用作神经物理引擎,通过微调模型、模拟并行世界、恢复伪动作、训练基础模型四步流程,为机器人生成大规模合成训练数据。人形机器人仅凭单一拾放任务即可学会倾倒、折叠等22种新行为,在新动词和陌生环境中实现零样本泛化(成功率分别达43%和28%)。相比传统图形引擎,该方法以恒定计算成本处理可变形物体、流体等复杂交互,团队计划数周内完全开源。
信息来源:X:Jim Fan (@DrJimFan) · NVIDIA
观点 / 方法精选
物理AI系统的评估是最难的问题:每次调试新的FSD版本都要撞车测试吗?
物理AI评估无法靠实车碰撞测试完成,传统游戏引擎(sim 1.0)也难以覆盖所有边缘情况。基于神经网络的sim 2.0由数据驱动,随车队规模扩展。Tesla已应用多年,用于生成近正面碰撞等罕见危险场景的训练数据,补充800万辆实车难以采集的极端案例。
信息来源:X:Jim Fan (@DrJimFan)
模型发布 / 更新精选
FastWan视频生成模型实现70倍加速,5秒出片
FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为"稀疏蒸馏"的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。
信息来源:X:Sky Computing Lab (@haoailab)
论文研究精选
智谱发布 GLM-4.5 系列模型并原生支持 SGLang
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Claude / GLM
观点 / 方法精选
机器人领域的小型 Moravec's paradox:对人类困难的体操动作反而更容易
机器人领域存在"莫拉维克悖论":后空翻等杂技比做饭、清洁更容易实现。前者可在模拟中训练并零样本迁移,无需感知环境;后者需要真实的视觉、接触物理和物体动力学,难以模拟。这导致外界困惑--机器人能炫技却做不好家务,只因通用灵巧性仍是未解难题。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
直到 AI 征服你深爱的领域,才可能真正"感受到 AGI"--每个人都有属于自己的"李世石时刻"
OpenAI 在 IMO 数学竞赛的突破让专业数学家陷入身份危机。作者以"能与狗对话的人发现翻译器在沃尔玛只卖4.99美元"比喻这种独特技能被 AI 商品化的失落感。这种职业终结的悲伤未来数年将蔓延至所有数学家、程序员和知识工作者,甚至让人提前面对生命终结的恐惧。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
论文研究精选
我对 AGI 的标准简单得多:AI 能在任何人家中烹饪任意菜系的丰盛晚餐
AGI 的门槛不是赢得诺贝尔奖,而是能去任何人家中烹饪任意菜系。物理图灵测试远比学术理论困难,Moravec 悖论将在未来十年持续困扰 AI 发展。
信息来源:X:Jim Fan (@DrJimFan)
行业动态精选
Thinking Machines实验室重启招聘并完成20亿美元融资,将发布多模态AI产品
Thinking Machines实验室宣布重启招聘,并确认已完成由a16z领投的20亿美元融资,NVIDIA、Accel等多方参与。该实验室致力于通过推进协作通用智能来增强人类能力,正在构建能通过对话、视觉等自然方式与人交互的多模态AI。其首款产品将于未来几个月内发布,产品将包含重要的开源组件,以助力研究人员和初创公司开发定制模型。实验室还计划分享其前沿科研成果,以推动AI社区发展。
信息来源:X:Lilian Weng (@lilianweng) · NVIDIA
模型发布 / 更新精选
2025年7月电路更新:特征语言重构数学框架与生物AI可解释性应用
Anthropic可解释性团队分享了2025年7月的研究进展。第一部分用"特征"语言重构Transformer数学框架,将注意力头的OV和QK电路描述为特征及其变换(如检测属性X、前一标记X、触发输出X的特征),并解释了先前用特征值分析复制头和归纳头行为的合理性。第二部分概述了稀疏自编码器在生物AI系统(如蛋白质语言模型ESM-2)可解释性中的应用进展,强调此类研究对确保药物发现等应用的安全与有效性至关重要。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2
OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。
信息来源:OpenRouter:Announcements(RSS) · Kimi / Cursor
模型发布 / 更新精选
最近在 X 上较为沉默。过去一年是转型之旅。Grok-4 与…
机器人领域正处于类似 2018 年 NLP 的混沌期,技术路线未定(世界模型、RL、sim2real 等),商业模式百花齐放,是入局的好时机。管理实验室并直接向 4 万亿美元公司 CEO 汇报消耗了全部精力,故在 X 上发言减少。坚信没有具身智能就没有 AGI。
信息来源:X:Jim Fan (@DrJimFan) · Grok
模型发布 / 更新精选
Kimi 发布 K2 模型
Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。
信息来源:Moonshot AI:Kimi Blog · Kimi
产品发布 / 更新精选
OpenRouter 免费套餐更新:引入新模型维持可访问 AI 推理
OpenRouter 发布免费套餐更新,通过引入新模型来维持可持续的 AI 推理服务,旨在继续为广大用户提供可访问的 AI 能力。
信息来源:OpenRouter:Announcements(RSS)
模型发布 / 更新精选
Grok 4
xAI 正式发布 Grok 4,新一代大模型在数学推理和代码生成能力上大幅提升,延续实时获取 X 平台信息的特色。该版本支持更长上下文窗口和图像理解,即日起向 X Premium+ 订阅者开放。
信息来源:xAI:News(网页) · Grok
观点 / 方法精选
反对"脑损伤"论
AI 对人类思维的影响具有两面性:既可能成为认知辅助工具,也可能导致思维退化,关键在于具体使用方式与程度。
信息来源:Ethan Mollick:One Useful Thing(RSS)
模型发布 / 更新精选
拥抱开放
DeepSeek 时刻后,AI 人才正从封闭的 OpenAI、Anthropic 流向拥抱开放科学与开源的 META。这种「拥抱开放」的趋势有利于行业透明度、科学进步与安全监管。OpenAI 承诺今夏发布开放权重模型,或将改变这一格局。
信息来源:X:Yann LeCun (@ylecun) · OpenAI / DeepSeek / Claude
模型发布 / 更新精选
OpenRouter 发布新隐身模型 Cypher Alpha
OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。
信息来源:OpenRouter:Announcements(RSS)
行业动态精选
Suno收购浏览器数字音频工作站WavTool
音乐技术公司Suno宣布收购完全在浏览器中构建的AI加速数字音频工作站WavTool。WavTool的核心团队将加入Suno并担任产品及工程领导职务。此次收购将WavTool的专业级编辑功能(支持VST插件、采样精确编辑等)与原生AI能力(如音轨分离、AI生成MIDI)整合到Suno平台,旨在增强对专业词曲作者和制作人的支持。Suno CEO表示,此举是为了更好地赋能音乐家,而WavTool联合创始人则认为双方在AI辅助音乐创作的愿景上高度一致。
信息来源:Suno:Blog(网页)
产品发布 / 更新精选
Claude Desktop推出"桌面扩展"新格式,实现MCP服务器一键安装
Claude Desktop推出了名为"桌面扩展"的新打包格式(.mcpb文件),旨在彻底简化MCP服务器的安装流程。该格式将服务器代码、所有依赖项和配置清单打包成一个ZIP压缩包。用户只需下载.mcpb文件并用Claude Desktop打开点击安装即可完成,无需手动配置环境、安装运行时或处理依赖冲突。此举解决了以往需要开发者工具、手动编辑配置文件和依赖管理等复杂问题,显著降低了非技术用户使用强大本地MCP服务器的门槛。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
Gemini Robotics On-Device 将 AI 引入本地机器人设备
Gemini Robotics On-Device 推出高效端侧机器人模型,具备通用灵巧操作与快速任务适应能力,支持本地设备直接部署运行。
信息来源:Google DeepMind:Blog(RSS) · Gemini
教程 / 实战精选
当下如何使用 AI:快速指南
一份当下 AI 工具的快速选用指南,聚焦目前值得使用的 AI 产品及其具体使用方法,帮助读者快速上手并选对工具。
信息来源:Ethan Mollick:One Useful Thing(RSS)