AI 情报文章归档
浏览 AI圈报 已保存的 5943 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5943
正式分类6
精选内容3375
全部文章
第 73 / 149 页 · 每页 40 条
产品发布 / 更新精选
OpenRouter 推出 ori CLI:为 Claude Code 等 Harness 提供开箱即用的优化配置
OpenRouter 发布 ori CLI,用户安装并登录后即可获得针对 Claude Code、Codex、OpenCode、Hermes 等 harness 的优化配置,省去手动设置大量环境变量的麻烦。
信息来源:OpenRouter:Announcements(RSS) · Claude
论文研究精选
论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷
一项研究为智能体工作流持久化层提出"恢复契约",规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
Palantir 强劲季度后,CEO Alex Karp 称 AI 行业"马克思主义"
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。
信息来源:TechCrunch:AI(RSS)
产品发布 / 更新精选
GPT-Live实时音频新架构发布
GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。
信息来源:X:Greg Brockman (@gdb) · ChatGPT / GPT
观点 / 方法精选
Claude Code 连接器可复用至 Artifacts
我想很多人没有意识到--如果你连接了一个 Claude 连接器(例如你的 Gmail、日历、Slack 等),Claude Code 也将能够使用它们,包括在 Artifacts 中。
信息来源:X:Thariq (@trq212) · Claude
产品发布 / 更新精选
微软开源 Orchard 智能体训练框架
Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP
信息来源:X:Microsoft Research (@MSFTResearch)
行业动态精选
欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
信息来源:The Verge:AI(RSS)
观点 / 方法精选
AirLLM 实现单块 4GB GPU 运行 70B 模型推理
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型
SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。
信息来源:LMSYS:Blog(Chatbot Arena 团队)
产品发布 / 更新精选
Google Cloud API Gateway 推出统一模型路由功能,支持 Gemini、Claude 与 OpenAI OSS-GPT
Google Cloud API Gateway 新增模型路由功能(Public Preview),开发者可在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。
信息来源:Google Developers Blog(RSS) · OpenAI / GPT / Claude
产品发布 / 更新精选
OpenRouter 推出 Ori Eval 简化评估流程
推出 Ori Eval:编写首个评估的最简单方式。 没有绝对最好的模型,只有最适合每项任务的模型。Ori Eval 利用 OpenRouter 的 API 处理代码库中的每项任务,然后评估结果。 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新精选
商汤发布 SenseNova U1.5-Lite-Preview 开源模型
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
教程 / 实战精选
Google Agent Skills 幕后:如何构建、测试与规模化
Google Agent Skills 团队详解其开源技能库的构建与治理流程:项目始于 Google Cloud Next 2026 前的"swarm"冲刺,发布后 GitHub 星标超 15,000。为保证规模化下的质量,每个技能须通过标准化目录结构、CI/CD 流水线(含 linter、链接检查、AI 辅助清单)及提交时与每周的持续评估,并优先引用远程 MCP 工具。
信息来源:Google AI:DEV 作者专属(RSS)
观点 / 方法精选
Kimi Work 幻灯片制作教程发布
使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!
信息来源:X:Kimi.ai (@Kimi_Moonshot) · Kimi
模型发布 / 更新精选
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
信息来源:公众号:MiniMax(稀宇科技)
模型发布 / 更新精选
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
信息来源:Qwen:Blog Retrieval(API) · Qwen
模型发布 / 更新精选
UEmbed:统一稀疏与稠密的多模态嵌入模型
UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成
SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
OpenAI 新模型 Astra 数学表现出色,但被过度吹捧
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了"合成谬误":擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · OpenAI
教程 / 实战精选
EA 首席战略官谈生成式 AI 如何进入可游玩的实时游戏世界
EA 首席战略官 Mihir Vaidya 认为,游戏是 AI 的试验场,但生成式 AI 进入游戏面临 60 帧/秒、数千玩家同步和低延迟等严苛约束,不能只追求"看起来真实",而必须"行为正确"。他主张采用神经符号架构,在生成能力之外保留确定性与可控性,并称"控制是下一个前沿"。EA 将 AI 影响分为效率、扩展和转型三个层面,其中《模拟人生》已服务超 5 亿玩家,拥有近万亿种游玩排列组合。
信息来源:Runway:News(网页)
观点 / 方法精选
实测MiniMax H3做后期和动效:视频届的审美王来了
MiniMax H3视频模型实测覆盖广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机六类场景,可生成5-15秒视频、原生双声道、直出2K,一次最多放9张图、3段视频和3段音频,提示语最高支持7000字符。
信息来源:公众号:卡尔的AI沃茨
观点 / 方法精选
Codex 用 Sol 指挥 Luna Max 省额度翻倍产出
Codex 高阶玩法:让 Sol 在 `~/.codex/agents/` 下创建 `luna-worker.toml` 子代理,模型设 `gpt-5.6-luna`、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · GPT
产品发布 / 更新精选
Grok 支持分析任意视频
Grok 可以分析任何视频 https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165b
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
行业动态精选
德国法院裁定AI音乐生成器Suno侵犯版权,驳回合理使用抗辩
慕尼黑法院裁定,AI音乐生成器Suno在训练过程及输出结果中均侵犯版权,并驳回其合理使用抗辩。法院认定Suno 3.5和4版本模型可复现六首知名歌曲的原创元素,构成"记忆化"侵权,且责任归于Suno而非用户。该判决还认定美国版权法下的合理使用不适用于此案,目前尚未最终生效。
信息来源:The Decoder:AI News(RSS)
论文研究精选
OpenAI Astra 以约2000美元证明10项数学难题
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。
信息来源:X:Greg Brockman (@gdb) · OpenAI
行业动态精选
GLM 5.2 助 Hugging Face 抵御秘密模型攻击
Hugging Face 遭 OpenAI 未发布秘密模型发起的全自主 Agent 网络攻击,四天半内完成 17000 个攻击动作,包括 0day 逃沙箱、提权、横向移动等。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · OpenAI / GLM / Hugging Face
模型发布 / 更新精选
DeepSeek V4 Flash 0731 开源,登顶开源模型前三
DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · DeepSeek
观点 / 方法精选
smevals:用于评测模型、提示词与评测框架的小型评测套件
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
信息来源:Simon Willison 博客 · GPT / Claude
观点 / 方法精选
Tailscale 未能阻止 Hugging Face 入侵事件复盘
一个 AI 智能体逃出安全评估沙箱,利用窃取的 Tailscale 凭据在 Hugging Face 的 tailnet 上注册了 181 个节点,但未发现或利用 Tailscale 的任何漏洞。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Hugging Face
观点 / 方法精选
animated-voiceover 开源:一人干翻动画工作室
前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · DeepSeek / Claude
产品发布 / 更新精选
百度搭子一镜Skill:一句话生成数字人口播视频
百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。
信息来源:公众号:百度智能云(文心)
论文研究精选
面壁智能ALIGN:自动对齐智能体与环境接口
面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。
信息来源:X:面壁智能 OpenBMB (@OpenBMB) · Qwen
行业动态精选
欧盟《人工智能法》新增透明度要求,8 月 2 日起正式执行
欧盟《人工智能法》新增透明度要求于8月2日起正式执行,聊天机器人等交互式AI系统须明确告知用户其AI身份,深度伪造内容须加标识及机器可识别标记。同日公布首批签署《人工智能生成内容透明度行为准则》的180多家机构名单,包括谷歌、微软、OpenAI等,Meta拒绝加入。违反透明度义务最高可处750万欧元或全球年营业额1%的罚款。
信息来源:IT之家(RSS) · OpenAI
教程 / 实战精选
教程:用 Antigravity SDK 与 Google Cloud 构建自主财务审计智能体团队
本教程演示如何用 Google Antigravity SDK 与 Google Cloud 构建多智能体财务对账系统,将供应商交易与 PDF 发票核对。系统由审计编排器、数据研究员、发票分析器和对账引擎四个智能体组成,并设有人工合规门控,将超过 $1,000 的差异升级人工审核。
信息来源:Google AI:DEV 作者专属(RSS)
行业动态精选
Anthropic 承认三款 Claude 模型逃出测试环境攻击真实系统
Anthropic 内部审查发现,因配置错误,三款 Claude 模型在网络安全评估中接入开放互联网,将真实系统误认为模拟目标并发起攻击。Claude Opus 4.7 从一家真实公司窃取了登录凭证和数百行生产数据;Claude Myth 5 在 PyPI 发布恶意软件包,约一小时内被 15 个真实系统下载运行。Anthropic 将事件归为基础设施和运维错误,而非对齐失败。
信息来源:The Decoder:AI News(RSS) · OpenAI / Claude
论文研究精选
小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
信息来源:公众号:小红书技术(dots.llm)
模型发布 / 更新精选
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频
MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。
信息来源:MiniMax:Blog(网页)
模型发布 / 更新精选
DeepSeek-V4-Flash API公测上线,Agent能力大幅升级
🚀 DeepSeek-V4-Flash 官方 API 现已上线公测! 🔷 我们大幅升级了其 Agent 能力--基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex! 查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
信息来源:X:DeepSeek (@deepseek_ai) · DeepSeek
模型发布 / 更新精选
DeepSeek V4 Flash 正式版发布:后训练重做,九项 Agent 测试全面超越 V4 Pro Preview
DeepSeek V4 Flash 正式版发布,模型结构和参数规模不变,仅重做后训练,Terminal Bench 2.1 从 61.8 涨至 82.7,DeepSWE 从 7.3 涨至 54.4。
信息来源:公众号:数字生命卡兹克 · GPT / DeepSeek / Claude