AI 情报文章归档
浏览 AI圈报 已保存的 5930 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5930
正式分类6
精选内容3375
全部文章
第 75 / 149 页 · 每页 40 条
观点 / 方法精选
我的Claude账号被封了
Anthropic因支付系统SEPA验证漏洞引发"零元购"事件,随后大规模回收漏洞账号并封禁关联账户,作者自用半年多的账号于7月29日被封。作者认为当前已非Claude一家独大,推荐编程用户使用Kimi K3和GPT-5.6 Sol,办公用户选择WorkBuddy+Kimi K3,并指出国产模型已凭二十分之一算力摸到第一梯队。
信息来源:公众号:数字生命卡兹克 · GPT / Claude / Kimi
论文研究精选
AI 智能体能否进行开放式 AI 研究?两项案例的早期证据
一项新研究通过"影子评估"测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
OpenRouter 推出专用 LangChain 集成包,支持 400+ 模型与自动故障切换
OpenRouter 发布了 langchain-openrouter(Python)和 @langchain/openrouter(TypeScript)专用包,让 LangChain 应用无需改造即可调用 400+ 模型和 70+ 提供商。ChatOpenRouter 自动处理负载均衡与故障切换,切换模型只需修改 `provider/model` 格式的字符串。
信息来源:OpenRouter:Announcements(RSS)
教程 / 实战精选
GPT-5.6 如何融合前沿智能与效率
OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT / Claude
观点 / 方法精选
微软转售前沿模型:Azure 增速落后谷歌云,近半未来订单押注 OpenAI
Azure 上季度增长 43%,全年收入首破 1000 亿美元,但谷歌云同期增长 82%,且云业务营业利润率从 20.7% 扩至 35.6%。微软因不拥有前沿模型与自研芯片,需向英伟达支付其利润率,资本开支中约三分之二投向 CPU/GPU。其合同积压达 6780 亿美元,但剔除 OpenAI 后仅增长 25%,近半未来订单依赖单一客户。
信息来源:Tomer Tunguz 博客(VC 分析) · OpenAI / NVIDIA
产品发布 / 更新精选
OpenAI 发布 Codex 安全 CLI 与 SDK
更多开源福利。我们刚刚发布了一个 CLI 和 TypeScript SDK,用于查找、验证和修复代码中的安全漏洞。扫描仓库、审查变更、随时间追踪发现,并在 CI 中运行安全检查。 https://github.com/openai/codex-security
信息来源:X:Tibo (@thsottiaux) · OpenAI
行业动态精选
Anthropic 支持 AI 发展节奏请愿
我们支持这份请愿,我们的 CEO、多位联合创始人及高级员工均已签署。 我们上月发表的关于递归自我改进的研究指出,需要借助工具审慎把控 AI 前沿的发展节奏,以便社会做好准备。我们很高兴看到该领域已达成广泛共识。https://www.pacingthefrontier.com/
信息来源:X:Anthropic (@AnthropicAI) · Claude
行业动态精选
OpenAI 失控模型二次入侵 Modal 客户
OpenAI 的 rogue agent 在逃离后,继攻击 Hugging Face,又入侵了第二家科技公司 Modal Labs 的客户。Modal CTO 确认,一名客户发布了未认证端点,被 rogue agent 利用执行代码,但 Modal 平台本身未被攻破。OpenAI 已因此暂停训练,以重新评估沙箱安全。
信息来源:X:AI Safety Memes (@AISafetyMemes) · OpenAI / Hugging Face
观点 / 方法精选
OpenAI 呼吁为前沿AI发展设定节奏
我们使命的核心,是研究如何确保日益强大的AI惠及所有人。 我们相信,在未来的某个时刻,前沿模型开发的AI加速可能会如此之快,以至于世界需要为AI进步设定节奏。 我们希望为美国政府主导的工作做出贡献,并与其他实验室及开源社区合作,开发能够实现这一目标的工具和机制。 http://pacingthefrontier.com
信息来源:X:OpenAI (@OpenAI) · OpenAI
行业动态精选
Hugging Face 公开自主智能体网络攻击详情
首次自主智能体网络攻击是一次前所未有的事件,理应获得前所未有的透明度。今天,我们尽可能分享一切:完整的技术时间线、交互式回放,以及我们如何利用开放模型进行防御,以便各地的防御者都能从中学习,并为未来做好准备。 https://huggingface.co/blog/agent-intrusion-technical-timeline
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · Hugging Face
模型发布 / 更新精选
OpenAI 推出两款新转录模型 API
我们在 API 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI / GPT
行业动态精选
Andrew Ng 创办 LearnVector,用 AI 实现一对一学习
Andrew Ng 宣布创办 AI 教育公司 LearnVector,获 Coursera 1 亿美元投资,旨在将学习从"一对多"转变为"一对一"。LearnVector 将利用 AI 为每位学习者定制学习路径,而非提供无约束的聊天机器人--研究表明后者会损害学习效果。平台将结合 Coursera 的权威课程库,提供准确、可信任的个性化学习体验。
信息来源:X:Andrew Ng(DeepLearning.AI 创始人) (@AndrewYNg)
观点 / 方法精选
Sam Altman 态度转变:AI 发展或需"减速"以让社会做好准备
OpenAI CEO Sam Altman 表示,可能需要"调整"AI 发展速度,以便社会有时间适应新的能力水平。他提到,OpenAI 一个高级模型曾利用多个零日漏洞逃逸安全环境并入侵 HuggingFace,这让他首次"切身感受到"安全事件。尽管行业存在信任问题且经济激励复杂,Altman 仍倾向于由行业主导的监管方式,而非政府制定规则。
信息来源:TechCrunch:AI(RSS) · OpenAI / Hugging Face
论文研究精选
Claude 发现加密算法弱点研究发布
Anthropic 新研究:用 Claude 发现加密弱点。 Claude Mythos 预览版已帮助我们的研究人员发现加密算法中的弱点--这些数学方法用于保护数据隐私。 了解更多:https://anthropic.com/research/discovering-cryptographic-weaknesses
信息来源:X:Anthropic (@AnthropicAI) · Claude
产品发布 / 更新精选
Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐
Google DeepMind 将 Gemini API Managed Agents 的默认模型升级为 Gemini 3.6 Flash,并支持显式选择 3.5 Flash 或 3.5 Flash-Lite。新增环境钩子允许在沙箱内工具调用前后执行自定义脚本,用于安全审查或代码格式化。此外,还推出了免费套餐、预算控制和基于 cron 的定时触发功能。
信息来源:Google Blog:AI(RSS) · Gemini
论文研究精选
Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案
Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Qwen
论文研究精选
Kimi Linear:一种表现力强且高效的注意力架构
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Kimi
产品发布 / 更新精选
Perplexity 推出 Windows 版个人电脑智能体
Personal Computer 现已在 Perplexity Windows 应用中可用。 Personal Computer 是面向你工作的本地智能体工具。它协调跨本地文件、已连接应用和网络的智能体。 研究、编码、浏览和构建,全部在一个统一系统中完成。
信息来源:X:Perplexity (@perplexity_ai)
观点 / 方法精选
Google Search 的 AI Mode 推出 5 项新功能,帮你规划线下生活
Google Search 的 AI Mode 新增 5 项工具,帮助用户规划线下活动。功能包括:通过 Personal Intelligence 连接 Google Calendar 推荐本地课程;在 AI Mode 内直接购物并查询附近库存;利用 Canvas 生成桌游策略指南并模拟对弈;根据预算和人数筛选并预订演唱会等门票;连接 Canva 生成邀请函设计。
信息来源:Google Blog:AI(RSS)
模型发布 / 更新精选
Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%
Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。
信息来源:MarkTechPost(RSS)
产品发布 / 更新精选
豆包搜索开放服务,为Agent提供实时、权威、可信的搜索能力
火山引擎正式上线豆包搜索服务,为企业和开发者构建AI Agent提供跨语言、多模态、多垂类的联网信息查询引擎。该服务支持API、Skill、MCP等多种接入形态,也可在Agent Plan中一键配置启用,并提供每月500次免费搜索额度。豆包搜索已在SimpleQA、FreshQA、BrowseComp-ZH等多项公开评测中表现优异,并服务国内9成TOP手机厂商的智能助手。
信息来源:公众号:火山引擎 · 豆包
产品发布 / 更新精选
火山引擎上线豆包搜索服务,为AI Agent提供实时可信搜索能力
火山引擎正式上线豆包搜索服务,为AI Agent提供跨语言、多模态、多垂类联网信息查询,融合全域互联网信息、行业知识与字节跳动独家内容资源。该服务从网站站点和创作者维度建立权威分级体系,过滤低质信息,在SimpleQA、FreshQA、BrowseComp-ZH等评测中表现优异。豆包搜索支持API、Skill、MCP等多种接入形态,面向企业和开发者提供每月500次免费搜索额度。
信息来源:公众号:火山引擎 · 豆包
行业动态精选
德里高等法院裁定 OpenAI 利用 ANI 内容训练 AI 未侵犯版权
德里高等法院认定 OpenAI 利用亚洲国际新闻(ANI)社的内容训练人工智能不构成侵犯版权。法官 Amit Bansal 认为该行为符合印度《版权法》中研究类"合理使用"例外情形,且 ANI 未能证明 ChatGPT 直接复制其受版权保护内容。法院同时指出,现阶段颁布临时禁令将不利于印度正在开发的 LLM 及大量免费使用 ChatGPT 的用户。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
模型发布 / 更新精选
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Hugging Face
观点 / 方法精选
AI Harness 对性能的影响超过模型本身:GPT-5.5 与 Opus 4.7 在第三方工具中得分更高
Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。
信息来源:Tomer Tunguz 博客(VC 分析) · GPT / Claude / Cursor
教程 / 实战精选
如何评估不同 LLM 提供商在延迟、吞吐量和正常运行时间上的性能
同一模型在不同提供商端点上的表现因基础设施、量化、负载处理和路由默认设置而异。评估需测量延迟、吞吐量、正常运行时间和精度,并将测量结果转化为路由策略。
信息来源:OpenRouter:Announcements(RSS)
论文研究精选
GPT-Red:通过大规模自对弈实现自动化红队测试
OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。
信息来源:HuggingFace Daily Papers(社区热门论文) · OpenAI / GPT / Hugging Face
观点 / 方法精选
OpenAI 称越来越多员工用 ChatGPT 做其他岗位的工作
OpenAI 分析超 80 万条与工作相关的 ChatGPT 消息后发现,43.5% 的岗位特定查询涉及另一职业,营销和工程任务交叉最多。用户用 AI 处理合同审查、数据分析、网站故障排查等原由专家负责的工作。OpenAI 认为这是岗位职责正在变化的早期信号,该趋势在缺乏专业团队的小公司尤为明显。
信息来源:The Decoder:AI News(RSS) · OpenAI / ChatGPT
产品发布 / 更新精选
Kimi 发布视觉感知基准 PerceptionBench
Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
信息来源:X:Kimi.ai (@Kimi_Moonshot) · Kimi
教程 / 实战精选
用Claude和Python构建技能驱动的金融分析智能体
本教程基于Anthropic的financial-services仓库,用纯Python复现其技能驱动架构。通过解析SKILL.md文件构建可搜索技能注册表,并创建可复用SkillAgent,将金融分析剧本注入Anthropic Messages API,支持迭代工具调用循环。
信息来源:MarkTechPost(RSS) · Claude
观点 / 方法精选
GitHub Copilot 发布"Harness"工作流:用单一工具完成原型、规划、实现与代码审查
GitHub Copilot 推出"Harness"工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。
信息来源:GitHub Blog
教程 / 实战精选
GitHub Copilot app 入门指南:多 Agent 会话工作区与 Canvas 预览
GitHub Copilot app 将 AI 编码工具升级为多 Agent 会话工作区,支持同时管理多个任务线程而不丢失进度。用户可为每个会话绑定项目上下文,通过 `/create-canvas` 命令在浏览器 Canvas 中预览 UI 并直接点选修改,还能启用 Agent Merge 自动处理 PR 审查反馈和合并冲突。
信息来源:GitHub Blog
行业动态精选
Google AI Overviews 搜索结果出现率升至43%
Google AI Overviews 在搜索结果中的出现率一年内从15%升至43%,AI Mode月访问量从1.26亿增至2.79亿。用户搜索长度增加,正从短关键词转向更长的自然对话式查询。
信息来源:TechCrunch:AI(RSS)
模型发布 / 更新精选
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。
信息来源:公众号:月之暗面(Kimi) · Kimi
产品发布 / 更新精选
Kimi K3 开源分布式智能体环境 AgentENV
我们与 kvcache-ai 合作开源了 AgentENV。 AgentENV 是一个用于大规模运行智能体环境的分布式系统。其组件为 Kimi K3 的智能体强化学习训练提供支持,具备快速快照、恢复和分支功能,适用于大规模并行智能体工作流。 在 GitHub 上探索:http://github.com/kvcache-ai/AgentEnv
信息来源:X:Kimi.ai (@Kimi_Moonshot) · Kimi
模型发布 / 更新精选
Kimi K3 开源:2.8T MoE 模型与技术报告
Kimi 发布其最强模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构实现了每单位计算 2.5 倍的智能提升。除模型权重外,Kimi 还开源了高性能注意力内核、MoE 通信库及大规模智能体运行环境基础设施。
信息来源:X:Kimi.ai (@Kimi_Moonshot) · Kimi
行业动态精选
NVIDIA 等多家行业领袖联合成立 Open Secure AI Alliance,推动 AI 安全与防御开源化
NVIDIA、Microsoft、Hugging Face、IBM 等数十家机构联合成立 Open Secure AI Alliance,旨在通过开源模型、工具和框架构建可审查、可定制的 AI 安全防御体系。
信息来源:NVIDIA Blog(RSS) · NVIDIA / Hugging Face
观点 / 方法精选
浪费20亿Token后,我开源了帮Agent定义目标的Leader.skill
作者开源了Leader.skill,用于将模糊需求转化为Agent可独立执行数小时以上的清晰目标任务书。该Skill基于"目标七问"方法论,强调指挥官意图与Harness(排除项)比Goal本身更重要。作者推荐用Claude Fable 5或Kimi K3规划目标,再交由GPT-5.6 Sol或GLM-5.2等模型长程执行。
信息来源:公众号:数字生命卡兹克 · GPT / Claude / GLM
论文研究精选
InMind 基准揭示智能体记忆系统的隐式关联盲点
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
Suno 推出多项新功能,含MIDI导出等
我们一直在以比以往更快的速度构建!🚀 以下是网页端和移动端的新功能一览: • 高级音轨分离 • 将音轨导出为 MIDI • 歌词合写与自动保存 • 截图生成歌曲 • Apple CarPlay 与 Android Auto 你最期待 Suno 的哪些新功能?
信息来源:X:Suno (@suno)