AI 情报文章归档
浏览 AI圈报 已保存的 5897 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5897
正式分类6
精选内容3375
全部文章
第 56 / 148 页 · 每页 40 条
观点 / 方法普通
战术编程已被AI取代,战略思维仍属人类
开发者Dex Horthy引用John Ousterhout的战术与战略编程之分,认为AI已基本取代战术编程(日常编码),但尚无证据表明它能进行战略思考(代码库健康、架构设计)。他将当前AI智能体比作"战术龙卷风"--产出惊人却毫无长远眼光。
信息来源:X:Dex Horthy(HumanLayer)(@dexhorthy)
产品发布 / 更新普通
苹果 Apple Store 应用 AI 助手悄悄上线,目前处于早期预览状态
苹果 Apple Store 应用正在逐步推送 AI 助手,目前处于"早期预览"状态。该功能可列出不同苹果产品、比较两款 iPhone、查询订单和处理以旧换新等,实例提示语为"帮我挑选一款 Apple Watch"。目前尚不清楚该功能向多少用户开放,外媒 Appleinsider 称其尚未收到推送。
信息来源:IT之家(RSS)
模型发布 / 更新普通
Generalist AI 发布 GEN-1.5:一个从 3-12 秒演示中学会新任务的机器人基础模型
Generalist AI 发布机器人基础模型 GEN-1.5,将 3-12 秒的传感器运动数据放入 30 秒上下文窗口即可执行任务,无需梯度更新或微调。在 10 项操作任务中,单次上下文提示平均成功率达 59%(±10%),每任务用 5 分钟数据做 10 步梯度更新后提升至 83%(±9%)。该能力并非显式训练,而是从超八个月预训练中涌现;目前无公开权重、API 或定价,属研究发布。
信息来源:MarkTechPost(RSS)
论文研究普通
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
卡迪夫大学和墨尔本大学研究发现,生成式AI目前无法像人类教师一样可靠评判学生书面作业。研究人员用ChatGPT两个版本按7项标准评分50篇生物科学论文,并采用4种提示方式,结果显示模型分数波动大,无法准确预测人工评分。除一种情况外,AI平均分普遍高于人工,最大差距达16.1分,单篇最大差距达40分,且分数系统性向中间集中。
信息来源:IT之家(RSS) · ChatGPT
产品发布 / 更新普通
Gemini 4 筹备启动,桌面端将迎 Avatar 支持
Google 正为 Gemini Desktop 添加 Avatar 支持,并推出 Customize 标签页供用户发现 Apps、Skills 与 Plugins。与此同时,Gemini 4 的筹备工作已开始,检测到 120+ 条相关新提及,与去年 Gemini 3 发布前的模式相似。
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
行业动态普通
第二届世界人形机器人运动会首个举重冠军诞生:北京人形-华科联队举起16公斤
8月24日,第二届世界人形机器人运动会举重项目完赛,北京人形-华科联队的机器人在15公斤基础重量上连续加码,最终成功举起16公斤,夺得本赛事首个人形机器人举重冠军。本届赛事吸引六大洲16个国家的666支队伍、2056台机器人参赛,队伍总量同比增长138%,机器人数量翻了两番。赛项从首届26项增至51项,新增举重、拔河、乒乓球等对抗项目及灵巧手精细操作赛项。
信息来源:IT之家(RSS)
模型发布 / 更新普通
LongCat-2.0 登陆 Go,开源 1M 上下文
LongCat-2.0 刚刚在 @opencode 上以 Go 语言版本发布 🐱 试试看,告诉我们你用它构建了什么! 1.6T/48B · 1M 上下文 · 完全开源
信息来源:X:美团 LongCat (@Meituan_LongCat)
观点 / 方法普通
预言机问题:AI 与医疗领域一个看不见的瓶颈
医疗 AI 面临"预言机问题":临床决策主观、底层数据不透明、评测易沦为营销,导致医院难以客观评估模型优劣。OpenAI 报告每周超 3 亿人用 ChatGPT 咨询健康问题,2026 年每百万条病历中约 1,686 条记录患者对模型回答的追问。a16z 正与 Protege 合作,试图通过追踪患者长期结局来解决这一评估难题。
信息来源:a16z:News(RSS) · OpenAI / ChatGPT
观点 / 方法普通
Agent 工程本质是分布式系统而非提示词工程
作者指出最贵的不是模型,而是工程系统:单日两轮任务跑 1 亿 tokens,仍有 13 条因 receipt identity mismatch 失败,模型已产出结果系统照样出错。真正难点在于幂等、状态机、回执、重试与可观测性。Agent 工程本质上更像分布式系统,而非 Prompt Engineering。
信息来源:X:小北 (@frxiaobei)
论文研究普通
清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡
清华等高校提出"表征平等"框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。
信息来源:X:面壁智能 OpenBMB (@OpenBMB)
模型发布 / 更新普通
路透社母公司汤森路透花 4000 万美元研发 AI 模型,基于阿里千问
汤森路透发布首款大语言模型Thomson,基于阿里千问Qwen3.5-397B构建,研发成本约4000万美元,外界流传的45万美元仅为最后一次训练成本。该模型在Stanford LegalBench得分0.823,落后于Gemini 3.1 Pro和GPT-5.5。汤森路透称不采用闭源模型是因外部模型长期成本较高且无法高自由度调整。
信息来源:IT之家(RSS) · GPT / Qwen / Gemini
论文研究普通
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。
信息来源:MarkTechPost(RSS)
模型发布 / 更新普通
LongCat-2.0 开源 Go 版发布
LongCat-2.0 现已在 Go 中可用 1.6T/48B · 1M 上下文窗口 · 完全开源
信息来源:X:opencode (@opencode)
模型发布 / 更新普通
dots3-note 预览版:面向长期任务的开放权重多模态模型
当一项任务持续数小时甚至数周,且外部世界不断变化时,AI 需要具备什么才能保持有用? 目标会演变。新的约束会出现。计划会失败。 认识一下 dots3-note 预览版,这是由 rednote 的 dots 工作室 @dotsstudioai 开发的开放权重多模态模型,面向现实生活中的长期任务自主性。 - 总计 280B / 激活 16B 参数 - 512K 上下文窗口 - 文本、视觉和语音理解 以下介绍它如何学习、自我评估并随时间适应。🧵
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
Hugging Face 据报正洽谈以 130 亿美元估值出售
Hugging Face 据 Business Insider 报道,已接获以 130 亿美元或更高估值收购的接洽,目前尚未达成协议,并已与银行商谈以评估竞标。
信息来源:TechCrunch:AI(RSS) · Hugging Face
模型发布 / 更新普通
Qwen 4 现身测试,多款新模型将至
好戏还在后头:显然还有一个新 Qwen 模型--Qwen 4--已经在测试中了。 所以现在我们有: - 新 Claude 模型(可能是 Opus 5.1 和 Haiku) - Ox Alpha(可能是 GLM-5.3 Flash) - Qwen 4(?) 都已在测试中或被目击。 + GPT Astra 已确认。 没错,接下来几周会很有趣。
信息来源:X:Kim (@kimmonismus) · GPT / Qwen / Claude
行业动态普通
千里科技上半年营收 51.2 亿元:智驾业务覆盖 16 款车型、净利润大增 151%
千里科技发布 2026 年半年度报告,上半年营收 51.20 亿元,同比增长 22.36%;归母净利润 0.78 亿元,同比增长 151.25%。智能辅助驾驶业务实现收入 12.35 亿元,占主营业务收入 24.3%,功能已覆盖 16 款车型,用户激活率达 93%。ASD 4.0 已全面推送,累计装车量突破 53 万辆,ASD 5.0 计划于今年年底推出。
信息来源:IT之家(RSS)
产品发布 / 更新普通
小米玄戒 O3 行业首发支持 LPDDR6,长鑫存储为核心合作伙伴
小米首款 AI 旗舰 SoC 玄戒 O3 今日发布,行业首发支持 LPDDR6,速率达 10667Mbps、4×24 bit 位宽、113.8GB/s 带宽,相比前代玄戒 O1 内存带宽提升 48%。据供应链消息,长鑫存储是该 LPDDR6 内存核心合作伙伴,这也是国产 LPDDR6 芯片首次在旗舰级处理器芯片上实现应用。
信息来源:IT之家(RSS)
论文研究普通
对抗式审查:结构化分歧提升智能体代码审查
一篇论文提出用"对抗式审查"规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
何小鹏:目标明年实现 Robotaxi 无安全员载客运营
小鹏集团董事长何小鹏今日透露,搭载第二代 VLA 的前装量产 Robotaxi 已在广州完成超 2000 次内测订单,跑通载人示范运营全流程,公司已完成云端接管平台开发,目标明年实现无安全员载客运营。小鹏近期组建集团级 BD 团队,正与海内外伙伴洽谈,推动图灵 AI 芯片、第二代 VLA 模型、Robotaxi 和人形机器人技术走向全球市场。
信息来源:IT之家(RSS)
产品发布 / 更新普通
雷军官宣 9 月为小米"科技大月",澎程系列新车与 Xiaomi 18 Pro/Fold 同月发布
雷军宣布 9 月为小米"科技大月",月初澎程系列新车上市并同场发布 Xiaomi 18 Fold,月底推出 Xiaomi 18 Pro 系列。小米 18 Fold 与小米平板 9 Pro Max 首发搭载玄戒 O3 AI 旗舰 SoC,安兔兔跑分 522 万,CPU 多核首破 15000 分,GPU 性能提升 85%、功耗降低 64%,并全球首发支持 LPDDR6。
信息来源:IT之家(RSS)
行业动态普通
何小鹏:今年 Q4 小鹏汽车将挑战单月销量突破 6 万辆
小鹏董事长何小鹏在半年报业绩会上透露,大五座旗舰车型 G9L 将于 9 月上市交付,MONA L05 计划四季度在国内上市,届时将挑战单月销量突破 6 万辆。搭载第二代 VLA 的前装量产 Robotaxi 已在广州完成超 2000 次内测订单,目标明年实现无安全员载客运营。机器人 IRON 计划今年底进入规模量产,2027 年正式上市并面向海外客户交付。
信息来源:IT之家(RSS)
观点 / 方法普通
Grok 4.6 能否整夜自主跑通真实任务
前苹果工程师让 Grok 4.6 在 Cursor 中执行两项任务后睡觉,次日直播验收成果,全程无需人工干预。SpaceXAI 围绕长时运行智能体任务构建 Grok 4.6,测试其能否在无人监督下持续工作,并对比了 Grok 4.6 与 Opus 5 的表现。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok / Cursor
行业动态普通
面壁智能公布 13 位 MiniCPM 大使名单
面壁智能 OpenBMB 公布 MiniCPM 大使计划首批 13 位入选开发者,其中 6 位来自中国、7 位来自海外社区。入选者基于技术专长、AI 项目经验及开源探索热情选出。该大使计划仍在开放申请中。
信息来源:X:面壁智能 OpenBMB (@OpenBMB)
模型发布 / 更新普通
Thomson Reuters 斥资 4000 万美元自研法律大模型"Thomson"
Thomson Reuters 基于阿里 Qwen 推出自研法律大模型"Thomson",投入约 4000 万美元,训练数据来自 Westlaw 等自有内容。在 Stanford LegalBench 上 Thomson(0.823)落后于 Gemini 3.1 Pro 和 GPT-5.5,仅在接入独家内容时以 0.83 对 0.82 微弱胜过 GPT 5.4。
信息来源:The Decoder:AI News(RSS) · OpenAI / GPT / Qwen
产品发布 / 更新普通
Runway Ruby 支持多模型直出专业格式
在 Runway 上用任意模型生成,然后通过 Ruby 将其提升至交付规格。无论你使用 Seedance 2.5、Gen-4.5 还是 MiniMax H3,都可直接转换为 16-bit EXR 或 10 位和 12 位 ProRes 及 HEVC。 点击下方链接立即体验。
信息来源:X:Runway (@runwayml)
行业动态普通
抱抱脸考虑130亿美元估值出售
openrouter 后的另一大新闻,Hugging Face 考虑以130 亿美元估值售。 就是央视上那家叫「抱抱脸」的公司。
信息来源:X:小北 (@frxiaobei) · Hugging Face
观点 / 方法普通
掌握自己的智能技术栈
掌握你自己的智能技术栈。 这是我对今天任何正在构建的人的建议。无论你是刚刚起步,还是已经在过程中。 其中一部分在于理解如何构建底层基础技术,以及在其之上构建应用/体验。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
NVIDIA 新论文提出 ACES 技能评估法
NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · NVIDIA
行业动态普通
零跑汽车:已在具身智能机器人领域有所规划
零跑汽车在2026年中期业绩会上表示,公司已在具身智能机器人领域有所规划,近期将公告具体信息。管理层认为,具备全域自研能力的新能源车企完全有条件做具身智能机器人。工商信息显示,零跑旗下公司7月全资设立湖州凌昇精密制造有限公司,注册资本2.1亿元,经营范围含工业机器人制造与智能机器人研发。
信息来源:IT之家(RSS)
观点 / 方法普通
AI生成图片普及,派对邀请函也AI化
现在所有孩子的派对邀请函都是用AI做的了。这事已经发生了,图像生成已经走向主流。 另外,这是不是Comic Sans字体的末日?
信息来源:X:fofr (@fofrAI)
行业动态普通
零跑汽车 2026 年度技术发布会定档 9 月,将发布"全行业第一梯队水平"辅助驾驶世界模型
零跑汽车通过上半年财报宣布,将于 9 月举办 2026 年度技术发布会,届时发布达到"全行业第一梯队水平"的智能辅助驾驶世界模型,以及三电领域一系列最新技术成果。创始人朱江明此前透露,公司经长期全域自研,将在第三季度对外公布多项创新技术,并规划更具创新性的产品。
信息来源:IT之家(RSS)
产品发布 / 更新普通
IBM 发布首款双架构大型机处理器:2nm 工艺,11 核心 5.7GHz
IBM 在 Hot Chips 2026 大会上发布首款双架构大型机处理器,基于 2nm 工艺,整合 11 个频率超 5.7GHz 的核心,并配备 AI 推理加速器、片上 DPU 和大容量缓存。该处理器可原生执行 IBM Z / LinuxONE 与 Arm 指令,使基于它的 Z 和 LinuxONE 系统能同时运行 IBM 和 Arm 平台的操作系统与应用,可扩展至数百核心和数十 TB 内存。
信息来源:IT之家(RSS)
观点 / 方法普通
AI Agent 事故启示:模型输出不等于系统状态
两个 AI Agent 事故暴露同一根因:把模型输出当成了系统状态。X 抓取 25/25 全失败,日报却写「新增 0 条」;待办「今天」未转标准日期,提醒直接消失。LLM 负责判断,确定性代码负责日期、状态、重试和告警--「没有结果」不等于「没有发生」。
信息来源:X:小北 (@frxiaobei)
观点 / 方法普通
知识工作新方式:Codex 采用激增
一种完成知识工作的新方式 【引用 @a16z】:AI 重度用户正出现在科技行业之外。自 2 月以来增长最快的 Codex 采用群体: 法律:108 倍 销售:41 倍 招聘:41 倍 营销:26 倍 医疗:24 倍 本周图表:https://www.a16z.news/p/charts-of-the-week-winds-of-thematic
信息来源:X:Greg Brockman (@gdb)
观点 / 方法普通
播客何以成为AI大佬发声第一现场
2026年过半,小宇宙站内AI相关人物搜索量同比增长470%,杨立昆、罗福莉、杨植麟等关键人物的深度对话几乎只出现在播客。Anthropic创始人达里奥对外发声9个链接中7个是播客。小宇宙AI话题节目近3年增速约300%,播客以高信噪比和完整语境成为AI故事的第一现场。
信息来源:X:阑夕 (@foxshuo) · Claude
模型发布 / 更新精选
GPT-5.6 登陆 Kiro,为开发者提升性价比
GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
论文研究普通
ContinualSkillBench:LLM 智能体能否真正进化能力?
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
燧原科技 9 月 2 日科创板申购,拟募资 60 亿元研发第五代和第六代 AI 芯片
燧原科技首次公开发行股票并在科创板上市,拟发行 4303.5173 万股,占发行后总股本 10%,网上网下申购日为 9 月 2 日。公司尚未盈利,此次拟募资 60 亿元,用于第五代和第六代 AI 芯片系列产品的研发及产业化等项目。燧原科技创立于 2018 年 3 月,与摩尔线程、沐曦股份和壁仞科技合称"国产 GPU 四小龙"。
信息来源:IT之家(RSS)
行业动态普通
字节 PICO Space Pro 头显发布时间调整至今年第四季度
字节旗下 PICO-XR 宣布,原定 9 月 2 日发布的 PICO Space Pro 头显调整至今年第四季度发布,以便对软件体验进行重大升级。该头显预计为"Project Swan",搭载 micro-OLED 面板(4000 PPI),采用双芯片架构,主处理器 CPU 和 GPU 性能为高通骁龙 XR2 Gen 2 的两倍。未来数月将扩大先锋体验计划。
信息来源:IT之家(RSS)