AI 情报文章归档
浏览 AI圈报 已保存的 5665 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5665
正式分类6
精选内容3361
全部文章
第 117 / 142 页 · 每页 40 条
论文研究精选
ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?
由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。
信息来源:Berkeley RDI:Blog(AI 安全与评测) · OpenAI / Claude
观点 / 方法精选
Claude 电脑与浏览器使用的最佳实践
Claude 最新模型在电脑与浏览器使用能力上显著提升,支持构建复杂智能体系统。本文针对Claude 4.6系列和Opus 4.7提供实践指南,重点优化截图分辨率:Claude 4.6系列API限制最大长边1568像素、总像素115万;Opus 4.7提升至最大长边2576像素、总像素375万。发送前将截图缩放到限制内是提升点击准确性的最有效方法。推荐起始分辨率为1280x720,Opus 4.7用户可优先使用1080p,并避免发送未经缩放的原始截图或过低分辨率图像。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Introducing Runway Agent
Runway正式发布Runway Agent,这是一个能够通过单次对话将创意想法转化为完整、可发布视频的智能创作伙伴。用户只需用自然语言描述需求,Agent便能根据上下文和目标,自主完成概念提案、故事节奏设计、视觉方向规划,并最终生成包含多场景、旁白、对话和音乐的成片。它旨在为品牌团队、营销人员、创意机构和电影制作人快速生产各类视频内容,如品牌宣传、社交媒体素材和短片,将传统需要数天或数周的审核制作周期压缩至几分钟。该产品现已上线,新免费计划用户可获得1500积分用于制作首…
信息来源:Runway:News(网页)
产品发布 / 更新精选
Anthropic推出面向小型企业的Claude服务包
Anthropic推出"Claude for Small Business"服务包,旨在帮助小型企业弥补在AI应用资源上与大型公司的差距。该产品包含一系列连接器和15个开箱即用的自动化工作流,能将Claude深度集成到QuickBooks、PayPal、HubSpot等企业日常工具中。其核心功能是自动化处理财务、运营、销售等领域的重复性任务,如规划薪资、月末结算、追踪发票和分析营销活动等。用户通过Claude Cowork界面操作并手动批准关键步骤,所有任务均由用户发起和控…
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
开放模型生态的复合增长
中国AI生态呈现高参与度与开放优先特征,开源模型社区形成自我强化循环。开发者基于主流架构二次创新,国产开源模型下载量季度环比激增超200%。开放协作降低了技术门槛,推动应用层涌现大量行业解决方案,模型微调工具使用量同比大幅增长。生态参与者通过贡献代码、数据及优化方案,持续反哺核心模型迭代,构建了技术红利共享的复合增长网络。
信息来源:Nathan Lambert:Interconnects(RSS)
行业动态精选
Demis携21亿美元融资,用AI攻克所有疾病
Isomorphic Labs在Demis Hassabis领导下完成21亿美元B轮融资,旨在将AI用于药物发现以攻克所有疾病。Demis强调AI的首要应用应是改善人类健康,而非仅开发聊天机器人。其团队此前凭借AlphaFold2解决了蛋白质结构预测难题,现在目标是将药物研发从漫长、昂贵、高失败率的试错过程,转变为可预测、可迭代的工程,有望将研发周期从10-15年缩短至2-5年,并大幅降低成本。这被视为人类用AI向所有疾病宣战的关键行动,有望变革医疗领域。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
行业动态精选
紧急警告:针对AI开发者的超大规模供应链攻击"Mini Shai-Hulud"正在爆发
代号"Mini Shai-Hulud"的大规模供应链攻击正在爆发,已波及TanStack、Mistral AI等170多个热门npm/PyPI包。攻击者通过劫持GitHub Actions CI管道,使合法项目自动发布带毒版本,并附有SLSA 3级证明以绕过验证。恶意软件会持久化修改用户配置文件,威胁删除home目录,并能利用窃取的CI密钥像蠕虫一样自动扩散。即使固定包版本,也可能在6分钟发布窗口期内中招。建议开发者立即冻结安装、使用工具自查,并全面轮换所有云密钥和访问凭证。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Mistral
教程 / 实战精选
财务团队如何使用 Codex
财务团队能够利用 Codex,基于实际工作输入构建管理层报告、报告包、差异桥接、模型检查和规划场景。该工具将自然语言指令转化为代码,自动化处理财务数据整合、差异分析和模型验证等复杂任务,从而提升报告生成效率与准确性,并支持快速创建多版本规划场景。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
教程 / 实战精选
Dungeons & Desktops: 使用 GitHub Copilot CLI 构建一款程序化生成的 Roguelike 游戏
一位 GitHub 员工利用 GitHub Copilot CLI 开发了一款扩展程序,能够将任何代码库转换成一个独特的 Roguelike 风格地下城。该工具通过 AI 辅助的代码生成,实现了程序化关卡创建,展示了 Copilot CLI 在创意编码和游戏原型开发中的实际应用潜力。项目核心是自动解析代码结构并生成对应的可探索地下城布局。
信息来源:GitHub Blog
产品发布 / 更新精选
Co-Scientist:一个加速研究的多智能体AI伙伴
Co-Scientist 是一款由 Gemini 构建的协作式 AI 助手,旨在帮助科研人员加速科学突破。它通过多智能体(multi-agent)的架构设计,作为研究人员的智能伙伴参与工作流程,以提升研究效率并推动创新发现。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Krea 2首款基础模型发布
这是Krea 2。 我们的首个基础模型,完全从零构建,旨在实现美学多样性和风格控制。 了解更多并获取早期访问权限👇
信息来源:X:Krea AI (@krea_ai)
产品发布 / 更新精选
展示 HN:Statewright--通过可视化状态机提升AI智能体可靠性
Statewright 是一个通过状态机为AI智能体提供约束的系统,能控制其在各阶段可使用的工具,从而聚焦推理并提升可靠性。它将工作流定义为规划、实施、测试等多个阶段,自动执行工具限制与状态转换。在本地模型测试中,两个模型在5项SWE-bench子任务上应用约束后,正确率从2/10显著提升至10/10。该系统已集成到Claude Code等平台,一个修复测试失败的典型工作流可在46秒内完成。
信息来源:Hacker News:AI 热帖 · Claude
行业动态精选
人工智能首要应用应是改善人类健康
我一直认为人工智能的首要应用应该是改善人类健康。 这项工作始于AlphaFold,现在通过@IsomorphicLabs重新构想药物发现,并致力于有朝一日攻克所有疾病! 我们已获得21亿美元新资金,正在加速实现这一目标。
信息来源:X:Demis Hassabis (@demishassabis)
行业动态精选
GLM-5.1获AA全新Coding Agent基准开源第一
全球权威评测机构Artificial Analysis发布全新Coding Agent Index,包含SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA三项基准,用于衡量模型与Agent harness组合的真实编程能力。闭源模型Opus 4.7(在Cursor CLI中运行)全球第一,智谱GLM-5.1(在Claude Code中运行)获开源第一,代表国产大模型在实际编程Agent场景达到SOTA水平。
信息来源:公众号:智谱(GLM) · Claude / GLM / Cursor
行业动态精选
全国首例 AI 代写"种草笔记"案宣判,法院判决工具提供者赔偿平台 10 万元
全国首例 AI 代写"种草笔记"不正当竞争案在浙江省杭州市中级人民法院宣判。被告 B 公司和 C 公司运营的 AI 写作工具能一键生成某社交平台风格的种草文案,以会员制营利,诱导用户发布虚假消费体验,破坏平台真实内容生态。法院判决被告赔偿原告经济损失及合理开支共计 10 万元,并创新性使用"四要素判定法",明确生成式人工智能服务提供者需尽到合理注意义务,为治理 AI 生成虚假信息划定了法律边界。
信息来源:IT之家(RSS)
行业动态精选
npm 生态遭大范围投毒:TanStack、Mistral AI、UiPath 等受波及,可窃取云密钥与 GitHub 令牌
网络安全机构Socket发现针对npm生态的大规模供应链攻击"Mini Shai-Hulud"。攻击者组合利用GitHub Actions的三种漏洞,绕过了双重身份验证等保护机制,向TanStack、Mistral AI、UiPath等知名项目的软件包中植入恶意版本。被篡改的包在安装时会自动执行恶意代码,窃取AWS、GCP、Kubernetes、GitHub令牌及SSH私钥等敏感凭证。此次攻击波及超过160个包名、近373个恶意版本,目前所有恶意版本已被清理。
信息来源:IT之家(RSS) · Mistral
观点 / 方法精选
答案之外:信息呈现方式正成为AI智能层的一部分
信息的结构与呈现方式本身正成为AI智能层的关键。当前,让大语言模型以HTML格式输出,能提供比默认Markdown更丰富的视觉布局与交互性,是值得尝试的技巧。长远来看,人类虽偏好用音频输入,但视觉(图像/动画/视频)才是更理想的AI输出形式,因为大脑约三分之一皮层专司视觉处理。AI输出形态将沿"原始文本→Markdown→HTML→交互式神经视频/模拟"的路径演进,最终可能由扩散神经网络直接生成交互视频。同时,输入方式也需融合音频、文本、视频及手势等多模态交互。在人机输入输…
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI)
论文研究精选
FrontierMath评测发现致命错误,将更新修正后分数
我们正在对FrontierMath的Tiers 1-4进行AI辅助审查。 这已标记出约三分之一题目存在致命错误, 且我们相信大多数标记是有效的。 在完成全面人工审核后, 我们将在修正的数据集上发布更新后的分数。
信息来源:X:Epoch AI (@EpochAIResearch)
行业动态精选
谷歌表示,犯罪黑客利用人工智能发现了一个重大的软件漏洞
谷歌披露,犯罪黑客利用人工智能技术发现并利用了一个重大的软件漏洞。该漏洞存在于广泛使用的开源软件中,可能导致大规模数据泄露或系统入侵。谷歌威胁分析小组追踪到此次攻击,并确认黑客借助AI工具显著提升了漏洞挖掘的效率与精准度。目前漏洞细节尚未公开,但相关软件维护方已发布安全更新。这一事件凸显了AI技术被恶意用于网络攻击的现实风险,对全球网络安全防御体系提出了新的挑战。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
Parameter Golf 揭示了关于 AI 辅助研究的哪些经验
Parameter Golf 项目汇聚了超过 1000 名参与者和 2000 多份提交作品,在严格限制条件下探索了 AI 辅助的机器学习研究、编码智能体、模型量化及新颖模型设计。活动展示了 AI 工具如何帮助研究人员在受限参数规模下优化模型性能,推动了高效模型架构与自动化代码生成技术的实践进展。核心发现包括智能体协作能显著提升研究效率,而量化技术可在微小精度损失下大幅压缩模型体积。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
论文研究精选
Learning Agentic Policy from Action Guidance
针对大型语言模型的智能体强化学习提出新方法ActGuide-RL,通过引入日常人类交互产生的海量动作数据作为规划式参考指引,帮助策略克服难以抵达奖励状态的探索障碍。该方法采用最小干预原则,仅在必要时自适应启用指引以匹配任务难度,同时通过混合策略训练将探索收益内化回无指引策略。在搜索智能体基准测试中,ActGuide-RL相比零强化学习基线在GAIA和XBench上分别提升10.7和19个百分点,性能与需要大量监督微调数据的流程相当,为智能体强化学习提供了减少对繁重监督微调依…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Learning to Explore: 通过探索感知策略优化扩展智能体推理能力
研究提出了一种探索感知的强化学习框架,使LLM智能体能够在不确定性高时才进行自适应探索。该方法通过变分推理设计了细粒度奖励函数,评估探索性行动对改善未来决策的潜力,并引入探索感知分组机制,在优化过程中将探索行动与任务完成行动分离。实验表明,该方法在一系列基于文本和GUI的智能体基准测试中取得了持续的性能提升。相关代码与模型已在GitHub和HuggingFace平台开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
解决循环:语言和推理的吸引子模型
吸引子模型解决了循环Transformer训练不稳定、成本高和深度固定的问题。它通过主干模块生成初始输出嵌入,吸引子模块迭代优化固定点,并利用隐式微分计算梯度,使训练内存与有效深度无关,迭代次数自适应收敛。在语言建模中,相比标准Transformer,困惑度最高降低46.6%,下游任务准确率最高提升19.7%,训练成本更低;一个770M参数的模型性能优于1.3B参数Transformer。在推理任务中,仅2700万参数模型在约1000个示例下,于Sudoku-Extreme…
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Claude / Hugging Face
观点 / 方法精选
在AWS上进行基础模型训练与推理的核心构建模块
本文面向使用开源框架的机器学习工程师,阐述了AWS如何为大规模基础模型的全生命周期提供核心基础设施。其核心是三大紧密集成的组件:配备多代NVIDIA GPU(如H100、H200及新一代Blackwell B200/B300)的大显存加速计算实例;用于集体通信的高带宽、低延迟网络(节点内NVLink与节点间EFA);以及可扩展的分布式存储。这些基础设施与Slurm/Kubernetes等资源编排系统、PyTorch/JAX等ML框架协同,共同支撑预训练、后训练和推理工作负载…
信息来源:Hugging Face:Blog(RSS) · NVIDIA / Hugging Face
行业动态精选
纳德拉出庭反击马斯克诉讼案:他明明有我的手机号,但从未抱怨过微软与 OpenAI 的合作
微软CEO纳德拉在马斯克诉OpenAI案中作证,反驳了马斯克关于OpenAI背离非营利初衷的指控。他出示了马斯克2016年的感谢邮件,证明其当时完全支持微软与OpenAI的合作,且微软为此承受了1500万美元亏损。纳德拉强调,双方一直保持沟通,但马斯克在合作深化期间从未提出抱怨,直至2024年才提起诉讼。他还将2023年OpenAI董事会解雇CEO奥尔特曼的事件评价为"业余之举",并透露自己曾介入帮助奥尔特曼复职。
信息来源:IT之家(RSS) · OpenAI
产品发布 / 更新精选
Codex插件助力AI应用与智能体开发提速
Codex现可通过OpenAI Developers插件,帮助您利用OpenAI API更快地构建AI应用和智能体。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
观点 / 方法精选
在脚本的shebang行中使用LLM
本文介绍了一种创新方法,将LLM工具直接嵌入脚本的shebang行中执行指令。通过LLM的fragments模式,shebang行可执行简单任务,如生成SVG图像;使用-T选项能调用外部工具(如llm_time)创作包含当前时间的俳句;更复杂的是运行YAML模板,其中定义了Python函数作为工具进行数学计算,示例中演示了计算2344乘以5252加134的过程,并通过调试输出展示了分步结果,最终得到12,310,822。这展现了LLM作为脚本解释器的强大扩展性,能够支持从内…
信息来源:Simon Willison 博客
产品发布 / 更新精选
Claude Code v2.1.139 版本更新
本次更新引入了多项新功能与优化。核心新增包括:集中管理会话的Agent视图(研究预览)、可设置目标并持续工作的`/goal`命令、实时调整滚轮速度的`/scroll-speed`命令,以及查看插件详情的`claude plugin details`命令。交互界面导航与控制能力得到增强。底层优化涵盖MCP服务器可获取`CLAUDE_PROJECT_DIR`环境变量、`/context all`的令牌估算会考虑模型分词器并显示舍入值。此外,修复了超过20项问题,如凭证死锁、内存…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
产品发布 / 更新精选
Replit推出并行代理 支持10个代理同时运行
认识Replit并行代理 通过并行运行多达10个代理来加速构建 每个代理都拥有您应用的独立副本 它们在各自的计算机上工作 然后以代理方式合并工作成果
信息来源:X:Replit (@Replit)
论文研究精选
智能体执行能力强但优化用户立场不足
通过SocialReasoning Bench测试发现,各模型呈现稳定模式--智能体能够胜任执行任务,但即便在明确要求优化用户利益的指令下,仍无法持续改善用户处境。https://msft.it/6011vPOLF
信息来源:X:Microsoft Research (@MSFTResearch)
教程 / 实战精选
使用ADK构建可暂停、恢复且永不丢失上下文的长时运行AI智能体
本文探讨了如何从无状态聊天机器人升级为生产级AI智能体,以管理长达数天或数周的企业工作流程(如HR入职)。通过引入Agent Development Kit(ADK),其架构核心采用持久状态机和持久化会话存储,确保智能体在"空闲时间"或服务器重启时永不丢失上下文。系统利用事件驱动的Webhook和多智能体委托机制,实现在暂停期间"休眠",并在唤醒后以高推理准确性恢复复杂任务,从而构建出具备韧性和可靠性的长时运行智能体系统。
信息来源:Google Developers Blog(RSS)
教程 / 实战精选
Anthropic 网络安全团队如何利用 Claude Code 构建威胁检测平台
Anthropic 检测平台工程团队技术负责人 Jackie Bow 运用 Claude Code 开发了 CLUE 威胁检测与响应平台。该平台通过自然语言界面连接内部系统,包含 CLUE Triage 自动初筛警报,整合上下文信息分配处置建议;以及 CLUE Investigate 支持分析师用自然语言查询日志,由 Claude 自动生成并执行查询,将数小时的人工分析缩短至几分钟。团队在一天内完成概念验证,一周内交付实现,显著提升了安全运营效率。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Code w/ Claude SF 2026开发者大会:基于AI指数级增长的构建
在Code w/ Claude SF 2026开发者大会上,Anthropic宣布提升开发者工具能力。Claude Code的速率限制翻倍,Claude Opus的API限制提高,以支持大规模可靠开发。同时,Claude平台上的托管智能体新增四项功能:"梦想"功能通过回顾会话优化记忆;多智能体编排支持主智能体并行委派子任务;"成果"功能通过定义输出标准提升任务成功率,内部测试显示最难问题成功率最多提升10%;Webhooks提供任务完成通知。大会主题演讲和分组会议录像已上线…
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Claude进军法律行业
Anthropic公司为法律行业发布20多个新的MCP连接器及12个专用插件,将Claude深度集成至合同管理、文档处理等法律核心软件栈。Claude现可直接在Microsoft Word、Outlook等办公应用中无缝工作,具备起草、修订、条款比对等可复用技能,并能自动化处理日常法律事务。公司同时宣布与多个司法公益组织合作,以扩大法律服务的可及性。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
菲尔兹奖得主亲测 ChatGPT 5.5 Pro:17 分钟出论文级成果,替学生拉响红色警报
菲尔兹奖得主 Timothy Gowers 测试 ChatGPT 5.5 Pro,AI 在 17 分钟内独立解决了一个加法数论公开难题,产出了博士论文级别的成果。整个过程无需数学指导,仅通过简单提示完成。Gowers 警告,若 AI 数学能力按此速度发展,将很快对数学研究领域构成危机,尤其冲击博士生培养。他呼吁数学系紧急应对,帮助学生寻找新出路。另一位菲尔兹奖得主陶哲轩则指出,人类数学家在 AI 时代的核心价值在于"消化"和深入理解证明。
信息来源:IT之家(RSS) · ChatGPT
产品发布 / 更新精选
Anthropic开源金融AI全栈模板,定义行业落地新标准
Anthropic在GitHub开源了金融服务行业AI解决方案完整模板库,包含10个端到端智能体、7个垂直行业插件及11家主流金融数据商的MCP连接器,覆盖投研、投行、风控等核心工作流。该库提供了从个人插件到企业API的部署方式,支持集成至Microsoft 365及私有云。此举为金融AI落地提供了开箱即用的标准作业程序,与OpenAI的消费级路线形成鲜明对比,凸显了其深耕企业场景、通过开源构建行业生态的战略意图。
信息来源:X:小北 (@frxiaobei) · OpenAI / Claude
教程 / 实战精选
ChatGPT 在 2026 年初如何扩大应用范围
2026年第一季度,ChatGPT的用户采用率大幅上升,其中35岁以上用户群体的增长最为迅速,同时用户性别比例也趋于均衡。这表明以ChatGPT为代表的人工智能技术正加速融入主流社会,其应用范围已突破早期以年轻技术爱好者为主的局限,向更广泛、更多元化的普通用户群体拓展。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
产品发布 / 更新精选
告别编写YAML:使用confingy配置机器学习系统
Runway开源了Python库confingy,旨在解决机器学习系统配置的长期痛点。该库允许开发者用纯Python代码(支持懒加载、类型检查和序列化)替代传统YAML配置文件,从而摆脱YAML作为图灵完备领域特定语言所带来的维护困境。confingy无需重构现有代码,即可满足跟踪构造函数参数、避免实例化昂贵对象(如大语言模型)等核心需求,有效改善了因复杂YAML配置导致的无法跳转定义、类型提示失效和重构困难等开发体验问题。
信息来源:Runway:News(网页)
产品发布 / 更新精选
帕累托代码以市场需求重塑模型选择
Pareto Code 是一种利用真实市场需求观察帕累托前沿的新方法 DeepSeek V4 Pro 占据首位,其次是 GPT 5.4 Mini 和 Gemini 3.1 Pro https://openrouter.ai/openrouter/pareto-code
信息来源:X:OpenRouter (@OpenRouter) · GPT / DeepSeek / Gemini
模型发布 / 更新精选
AntLingAGI发布万亿参数模型Ring-2.6-1T
AntLingAGI发布了其万亿参数旗舰"思考模型"Ring-2.6-1T,该模型在5月15日前可通过OpenRouter免费使用。其核心特性包括可调节的思考强度,能动态平衡认知深度、token成本和执行速度;专为智能体优化,适用于高频工作流,提供快速的多步执行和工具调用;并具备深度思考能力,以应对严密的数学逻辑和科学研究任务。模型旨在满足实际生产环境中复杂任务的需求。
信息来源:X:OpenRouter (@OpenRouter)