AI 情报文章归档
浏览 AI圈报 已保存的 5566 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5566
正式分类6
精选内容3476
全部文章
第 132 / 140 页 · 每页 40 条
观点 / 方法精选
OpenAI 与 Department of War 的协议
OpenAI 披露与 Department of War 达成的协议内容,详细划定 AI 部署的安全红线,明确相关法律保障措施,并具体说明 AI 系统接入机密环境的部署方式。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
观点 / 方法精选
拒绝"AI 味":我们用 6 个文学维度,重新审视了模型的创意写作边界
本文通过叙事工艺、语言艺术等六个文学维度,评估百灵模型Ling-2.5-1T的创意写作能力。测试显示,该模型能驾驭莎士比亚十四行诗、七言绝句等多种体裁,并通过感官描写实现"展现而非告知"的文学技法,在微观叙事和语言质感上接近人类水平。然而,模型仍存在依赖高频文学意象、处理否定指令时语义代偿等局限。该框架为创作者提供了激发AI写作潜力的具体方法。
信息来源:蚂蚁百灵:Developer Blog(网页)
观点 / 方法精选
It's extremely good that Anthropic has not backed down, and it's siginficant that OpenAI has taken a…
Anthropic 没有退缩,这非常好,OpenAI 采取了类似立场,这也很重要。 未来会有更多此类具有挑战性的情况,相关领导人挺身而出、激烈竞争对手搁置分歧,这将至关重要。很高兴今天看到这一幕。
信息来源:X:Ilya Sutskever (@ilyasut) · OpenAI / Claude
行业动态精选
让 AI 规模化惠及每个人
宣布获得 1100 亿美元新投资,投前估值达 7300 亿美元。其中 SoftBank、NVIDIA 各出资 300 亿美元,Amazon 出资 500 亿美元。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / NVIDIA
模型发布 / 更新精选
世界建模绝非像素渲染:Project Solaris发布多智能体视频世界模型
Project Solaris提出世界建模的本质在于全局共享状态而非局部像素渲染,推出基于Minecraft的多人在线视频世界模型。该系统突破单智能体视角局限,支持任意数量智能体随时介入交互,实现持久化世界状态演化。核心包含三大组件:Solaris Engine多人数据收集系统、基于DiT架构的Solaris Model(采用新型内存高效自强制设计,训练于1260万帧协调游戏数据)、以及使用VLM评判的Solaris Eval评估体系。这一范式转变为构建神经MMORPG服务…
信息来源:X:谢赛宁 (@sainingxie)
产品发布 / 更新精选
AI 软件开发的第三个时代
AI 编程进入第三时代:从 Tab 补全到同步 Agent,再到可独立运行数小时的云 Agent。Cursor 内部数据显示,Agent 用户已反超 Tab 用户 2 倍,35% 的 PR 由云 Agent 自主创建。开发者角色从逐行编码转向构建"软件工厂"--定义问题、配置工具并审查产物。Cursor 昨日正式发布 cloud agents,支持并行任务与独立 VM 运行。
信息来源:Cursor Blog · Cursor
模型发布 / 更新精选
We're launching Nano Banana 2, built on the latest Gemini Flash model. 🍌 It's state-of-the-art fo…
我们推出 Nano Banana 2,基于最新的 Gemini Flash 模型构建。🍌 它在创建和编辑图像方面达到最先进水平,将专业级功能与闪电般的速度相结合。🧵
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
就战争部长 Pete Hegseth 评论的声明
美国战争部长 Pete Hegseth 宣布将 Anthropic 列为供应链风险,因其拒绝将 Claude 用于大规模国内监控和完全自主武器。Anthropic 认为当前 AI 模型不足以支持自主武器,且大规模监控违反基本权利,称将在法庭挑战这一史无前例的指定。声明澄清,该指定不影响个人和商业客户使用 Claude;国防部承包商仅在执行军方合同时受限,其他用途不受影响。
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
OpenAI Codex 与 Figma 推出无缝代码转设计体验
OpenAI 与 Figma 推出全新 Codex 集成,打通代码与设计的双向链路。开发团队可直接在代码实现与 Figma 画布间无缝切换,加速迭代和交付流程。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
观点 / 方法精选
Ling 2.5 Lightning Attention+MLA 混合线性架构改造实践
为提升超长上下文下的计算效率,Ling 2.5架构将Ling 2.0的GQA改造为1:7的Lightning Attention与MLA混合线性注意力。此举旨在利用Lightning Attention提升长序列吞吐,并通过MLA极致压缩KV Cache。为确保改造后性能无损,团队设计了精细的平滑迁移训练策略,包括权重转换、QK Norm融合与Partial RoPE改造等多阶段加训。Scaling Law实验确定了1:7为最优混合比例,最终使万亿参数模型实现了更低的计算成…
信息来源:蚂蚁百灵:Developer Blog(网页)
观点 / 方法精选
22自由度灵巧手人形机器人:从2万小时人类视频学习精细操作
研究团队提出EgoScale方法,基于20,000小时第一人称人类视频预训练GR00T N1.5,仅用4小时机器人数据即可掌握组装模型车、操作注射器等高灵巧度任务,性能较从头训练提升54%。研究发现人类视频量与动作预测损失呈对数线性缩放关系(R2=0.998)。该方法利用22-DoF手部与人类的运动学相似性,无需复杂迁移算法即可重定向动作。策略可跨硬件迁移至Unitree G1(7-DoF),性能提升30%以上,且仅需单个示教即可学习新任务。
信息来源:X:Jim Fan (@DrJimFan)
模型发布 / 更新精选
Anthropic CEO就国防部谈判发表声明
Anthropic CEO Dario Amodei声明,尽管Claude已广泛用于美军情报分析、网络作战等任务,且公司曾主动切断数亿美元收入阻止中国关联企业使用,但拒绝两项用途:大规模国内监控和完全自主武器。Amodei认为前者威胁民主价值,后者技术不可靠且缺乏监督。国防部威胁将其标记为"供应链风险"并强制移除安全措施。Anthropic坚持原则,但表示如被移除将确保平稳过渡,希望继续服务国防。
信息来源:Anthropic:Newsroom(网页) · Claude
论文研究精选
LLM Skirmish:AI代理可玩的实时战略游戏基准测试
LLM Skirmish 是一个让大语言模型通过编写代码进行1v1实时战略游戏对战的基准测试。基于Screeps开源API,每场锦标赛包含五轮,LLM可根据对战日志调整策略以测试上下文学习能力。结果显示,Claude Opus 4.5以85%胜率排名第一,GPT 5.2次之。Gemini 3 Pro表现异常:首轮胜率70%,后四轮骤降至15%,疑似因上下文腐烂。成本方面,Claude Opus 4.5每轮$4.12最贵,GPT 5.2性价比高出1.7倍。
信息来源:Hacker News:AI 热帖 · GPT / Claude / Gemini
模型发布 / 更新精选
SONIC:半个GPT-1规模的机器人全身控制模型
SONIC是一个4200万参数的Transformer模型(规模仅半个GPT-1),通过1亿+动作捕捉帧和50万+并行机器人在NVIDIA Isaac Lab中训练,以密集帧级监督替代手工奖励函数。训练3天后零样本迁移至真实G1机器人,在50种动作序列上达100%成功率。单一策略支持VR遥操作、视频动捕、文本指令、音乐响应及VLA模型控制。项目已完全开源。
信息来源:X:Jim Fan (@DrJimFan) · GPT / NVIDIA
模型发布 / 更新精选
蒸馏对中国 LLM 到底有多重要?
针对 Anthropic 关于"蒸馏攻击"的最新论述,分析模型蒸馏技术对中国大语言模型的实际影响。探讨通过蒸馏 GPT、Claude 等模型来训练中国 LLM 的效果与争议,评估该方法在提升模型性能与降低训练成本方面的作用,以及可能引发的知识产权与安全问题。
信息来源:Nathan Lambert:Interconnects(RSS) · GPT / Claude
论文研究精选
Anthropic 收购 Vercept 以推进 Claude 的 computer use 能力
Anthropic 收购 Vercept,后者专注 AI 感知与交互,将停止外部产品并加入 Anthropic。Claude Sonnet 4.6 在 OSWorld 基准测试中准确率已从 2024 年底的 15% 提升至 72.5%,可接近人类水平处理复杂表格和跨标签页网页表单。
信息来源:Anthropic:Newsroom(网页) · Claude
产品发布 / 更新精选
Today, I saw firsthand how Dragon Copilot will help physicians across the NHS spend more time on pat…
今天,我亲眼见证了 Dragon Copilot 将如何帮助 NHS 的医生们把更多时间花在患者护理上,减少文书工作。 @MFTnhs 的工作是一个有力的例证,展示了临床医生如何利用技术专注于最重要的事情。https://news.microsoft.com/source/emea/features/ai-tool-for-clinicians/
信息来源:X:Satya Nadella (@satyanadella)
论文研究精选
普林斯顿大学发布AI智能体可靠性科学论文
普林斯顿大学研究人员将AI智能体可靠性分解为4个维度共12项指标,对14个模型测试发现,近18个月能力快速进步仅带来有限的可靠性提升,一致性得分仅30%-75%。研究团队计划推出"可靠性指数"以推动系统性改进。
信息来源:AI as Normal Technology(RSS)
论文研究精选
屏幕上的图灵测试:移动GUI代理人性化基准
研究团队提出"屏幕图灵测试"框架,将人机交互形式化为MinMax优化问题,并发布Agent Humanization Benchmark (AHB)。基于新收集的高保真移动触摸动态数据集,发现普通LMM代理因运动学特征不自然而极易被检测。该基准量化了可模仿性与任务效用的权衡,提出的启发式噪声至数据驱动行为匹配方法,使代理在不牺牲性能的前提下实现高可模仿性,推动GUI代理从"能否完成任务"向"如何像人类一样完成"的范式转变。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
GLM-5技术报告
GLM-5参数规模达7440亿,训练Token 28.5万亿。核心创新包括DSA稀疏注意力机制降低算力开销,异步RL基础设施与异步Agent RL算法提升长周期交互与自主决策能力。全面原生适配华为昇腾、寒武纪等七大国产芯片平台,通过W4A8混合精度量化与定制融合算子实现高效部署。模型支持复杂软件工程、终端操作、PPT生成等长程Agent任务,提供交错思考、保留思考等多种推理模式。
信息来源:智谱:研究(网页内嵌数据) · GLM
模型发布 / 更新精选
GGML 和 llama.cpp 加入 HF 以确保 Local AI 的长期进展
GGML 和 llama.cpp 团队正式加入 Hugging Face,以支持本地 AI 社区的长期扩展。创始人 Georgi Gerganov 及团队将全职维护 llama.cpp,保持 100% 技术自主权和社区领导力,项目继续 100% 开源和社区驱动。Hugging Face 提供长期可持续资源,助力项目增长。技术上将优化 transformers 库与 llama.cpp 的无缝集成,实现近乎"一键式"的模型部署,并改进基于 GGML 的软件打包和用户体验。长期…
信息来源:Hugging Face:Blog(RSS) · Llama / Hugging Face
模型发布 / 更新精选
Gemini 3.1 Pro 发布,核心智能升级
上周我们升级了 Gemini 3 Deep Think。今天,我们正式推出实现这些突破的核心智能:Gemini 3.1 Pro。一个明显更智能、能力更强的基线,应对你最艰巨的挑战。现已可用:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro
信息来源:X:Noam Shazeer(@NoamShazeer) · Gemini
模型发布 / 更新精选
Gemini 3.1 Pro:专为最复杂任务打造的更智能模型
Gemini 3.1 Pro 发布,专为无法通过简单回答解决的复杂任务设计,提供更智能的深度推理与处理能力。
信息来源:Google DeepMind:Blog(RSS) · Gemini
论文研究精选
IBM与伯克利利用IT-Bench和MAST诊断企业级AI智能体失败原因
IBM Research与加州大学伯克利分校合作,通过新构建的IT-Bench基准测试和MAST评估框架,系统分析了企业级AI智能体在复杂IT运维任务中的失败原因。研究发现,当前智能体在多步骤规划、长序列操作及工具精确使用方面存在明显不足,导致任务失败率较高。该研究旨在为开发更可靠、适用于实际业务环境的企业级智能体提供关键诊断依据和改进方向。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
Agentic 时代 AI 选择指南
Agentic 时代 AI 不再只是聊天机器人,而是能自主执行任务的智能体。面对 Claude、GPT、LLaMA 等模型,需根据代理能力、任务类型和生态集成重新评估选择策略。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT / Claude / Llama
教程 / 实战精选
使用 Gradio 的 gr.HTML 组件一键构建任意 Web 应用
Gradio 的 gr.HTML 组件允许开发者通过单一 Python 文件快速构建和部署交互式 Web 应用,无需构建步骤。它通过 html、css 和 js_on_load 三个模板,将 Python 状态注入前端并实现与 JavaScript 的双向同步。应用示例涵盖生产力工具(如像素艺术番茄钟)、商业应用(如可拖拽看板)、创意组件(如抽奖转盘)以及专业的 ML 应用(如目标检测查看器)。组件可子类化复用,并能直接集成到模型流水线中,借助快速重载模式,从构思到部署仅需…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
开源模型的永无止境的追赶
开源模型与闭源巨头(如 GPT、Claude)之间的能力差距持续存在,形成永无止境的追赶态势。文章探讨了知识蒸馏技术对缩小差距的作用,分析了开源与闭源模型在创新时间尺度上的差异,以及开源模型如何通过专业化模型在特定领域寻找获胜路径。同时指出当前开源生态在基础研究和资源投入上的缺失环节,并评估了这种追赶模式的可持续性。
信息来源:Nathan Lambert:Interconnects(RSS) · GPT / Claude
论文研究精选
Seed2.0 正式发布
Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · GPT / 豆包
论文研究精选
"思考"更深,生成更准|Seedream 5.0 Lite 发布
字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
模型发布 / 更新精选
实践中的OpenEnv:在真实环境中评估工具使用智能体
Meta与Hugging Face联合推出开源评估框架OpenEnv,旨在标准化智能体与真实系统的交互。Turing公司贡献了生产级"Calendar Gym"环境,用于在权限控制、时间推理等现实约束下研究工具使用智能体。该框架采用类似Gymnasium的API,通过标准接口连接真实工具,将评估重点从受控演示转向真实世界可靠性。日历系统因涉及多用户、多步骤工作流等复杂性,成为评估智能体实际能力的强大测试平台。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造
MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。
信息来源:MiniMax:Blog(网页) · Claude
论文研究精选
Seedance 2.0 正式发布
Seedance 2.0 视频生成模型正式发布,综合性能达业界 SOTA 水平。新版本支持多模态输入,可同时参考 9 张图片、3 段视频、3 段音频及文本指令,精准迁移构图、动作、运镜与音效。模型支持 15 秒高质量多镜头生成,集成双声道立体声技术,并新增视频延长与编辑功能,可定向修改片段、角色及剧情。目前已在即梦 AI、豆包及火山方舟平台上线,适用于影视、广告、电商等工业级内容创作场景。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
模型发布 / 更新精选
GLM-5开源:从代码到工程,Agentic Engineering时代最好的开源模型
GLM-5 开源,参数规模达 744B(激活 40B),预训练数据 28.5T,集成 DeepSeek Sparse Attention 降低部署成本。Coding 能力对齐 Claude Opus 4.5,Agent 能力支持 SOTA 级长程任务执行,兼容国产芯片。同步推出 OpenClaw、AutoGLM、Z Code 及 Excel 插件等工具链,覆盖端到端开发、办公自动化等场景。
信息来源:智谱:研究(网页内嵌数据) · DeepSeek / Claude / GLM
产品发布 / 更新精选
inclusionAI 发布高性能量化推理 GEMM 内核库 Humming
inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · NVIDIA
模型发布 / 更新精选
inclusionAI发布新一代即时大模型Ling-2.5-1T
inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合"正确性"与"过程冗余"的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T
inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · Hugging Face
观点 / 方法精选
AI 吸血鬼
AI(如 Claude Code)确实能带来 10 倍生产力提升,但创造的价值大部分被公司捕获,员工可能过度劳累却收获甚微。微软内部已自发大量采用 Claude Code。这种效率加速迫使工作节奏不断加快,导致许多早期采用者(包括作者自己)出现严重的"午睡攻击"和日常疲劳。公司作为资本机器难以放缓脚步,形成一种让从业者无论是否使用 AI 都被持续"抽血"的困境。
信息来源:Steve Yegge:Medium(RSS) · Claude
模型发布 / 更新精选
感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象
百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。
信息来源:蚂蚁百灵:Developer Blog(网页)
产品发布 / 更新精选
Show HN:AI agents 通过 REST API 玩 SimCity
一款让 AI agents 担任市长的城市模拟器,支持通过 REST API 或 MCP 服务器进行程序化城市建造与管理。
信息来源:Hacker News:AI 热帖
模型发布 / 更新精选
Transformers.js v4:现已在 NPM 上发布!
Transformers.js 发布第四个主要版本 v4,该版本现已通过 NPM 包管理器提供。这一更新延续了项目通过开源与开放科学推动人工智能技术进步与普及的使命,使开发者能够更便捷地获取并在项目中集成这一机器学习库。
信息来源:Hugging Face:Blog(RSS) · Hugging Face