AI 情报文章归档
浏览 AI圈报 已保存的 5721 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5721
正式分类6
精选内容3361
全部文章
第 105 / 144 页 · 每页 40 条
行业动态精选
苹果WWDC将推AI升级:Gemini蒸馏模型本地运行,但技术栈外部依赖显著
苹果下月WWDC将重点展示延迟已久的Siri及设备端AI升级,核心是在iPhone芯片本地运行从Google Gemini蒸馏而来的更小模型,以强调隐私与降低token成本。但该技术栈大部分源自外部:本地模型由Gemini蒸馏,设备无法处理的复杂查询将路由至Google Cloud处理,并采用了Nvidia的机密计算技术。苹果据称正在寻觅小型设备端AI初创公司以加速模型缩减工作。此外,苹果2024年承诺的Private Cloud Compute方案原计划使用苹果芯片,因无…
信息来源:X:Kim (@kimmonismus) · Gemini / NVIDIA
观点 / 方法精选
Step 3.7 Flash:可运行于桌面级设备的198B视觉模型
阶跃星辰发布了Step 3.7 Flash,这是一款198B参数的视觉模型,旨在DGX Spark等桌面设备上运行。用户实测表明,128GB统一内存是运行门槛,模型占用约104GB。部署无需官方专用llama.cpp分支,主线版本即可。在上下文长度上存在权衡:启用视觉功能时,基于q8 KV cache的64K为上限;若要使用最高256K上下文,则需禁用视觉并切换至q4 KV cache,此时模型与缓存共占约114GB内存。该模型是推理模型,思考过程可能消耗大量max_tok…
信息来源:X:阶跃星辰 StepFun (@StepFun_ai) · Llama
行业动态精选
6000 多公里全程零干预:特斯拉 FSD 完成全球首次横穿加拿大自动驾驶
一辆特斯拉汽车搭载 FSD V14.3.3 版本软件,完成了全球首次全程零人工干预、横穿加拿大的自动驾驶行程。车辆从温哥华出发,历时 4 天 21 小时,行驶 3760 英里(6051 公里)抵达哈利法克斯,全程所有驾驶操作(包括高速并线、应对复杂路况与自动泊车)均由系统自主完成,无任何系统退出或人工修正。该版本随 2026.14.6.6 更新推送,整合了春季软件功能。
信息来源:IT之家(RSS)
观点 / 方法精选
AI引发的职业焦虑:席卷科技从业者的心理危机
AI 技术的快速发展在科技从业者中引发了普遍的职业焦虑与心理危机。文章指出,许多专业人士担心自身技能被自动化取代,从而产生强烈的不安全感、抑郁情绪及身份认同危机。这种焦虑不仅源于对失业的恐惧,也涉及工作意义感的丧失、人际关系的变化以及对未来的迷茫。面对冲击,个体反应不一,但整体而言,这已演变为一场需严肃对待的行业心理挑战。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
定位何处:基础模型能否通过主动探索达到目标视角
研究提出目标视角复现任务(TVR)与模拟基准TVRBench,评估基础模型在3D环境中主动调整视角以匹配目标图像的能力。当前最优开源与闭源模型成功率仅7.8%和12.0%,瓶颈在于处理多轮视觉历史及需要平移而非旋转时的性能下降。通过构建统一的后训练框架,视觉动作SFT将9B开源模型成功率提升至50.8%,多轮GRPO进一步达到51.4%,为训练主动感知与行动的模型提供了基准。代码与模型已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
ChartArena:跨语言、场景与格式的图表解析基准测试
ChartArena 是一个旨在系统评估图表解析模型的双语基准测试。它覆盖了八种图表家族(包括数字图表与流程图等结构),并针对数字渲染、打印照片和手绘照片三种场景进行评估。数据集采用人机协作标注流程,并设计了格式无关的评估协议,将不同模型输出映射到标准化语义空间进行评分。对26个多模态大语言模型的评估显示,前沿闭源模型如Gemini 3.1 Pro领先,开源系统正快速追赶;文档解析模型在数字图表上表现尚可,但在图表结构上明显不足;专业解析器仍局限于特定图表类型。雷达图和手绘…
信息来源:HuggingFace Daily Papers(社区热门论文) · Gemini / Hugging Face
论文研究精选
τ_0-WM:用于机器人操控的统一视频-动作世界模型
τ_0-World Model (τ_0-WM) 是一个统一的视频-动作世界模型,旨在机器人执行动作前预测并评估其未来后果。模型基于共享的视频扩散主干网络构建,提供两个接口:一个联合预测未来视觉潜在表示与连续动作块的视频动作模型,以及一个能将动作序列展开为多视角未来并预测任务进度分数的动作条件视频模拟器。τ_0-WM 使用约27,300小时的多元数据训练,包括真实机器人遥操作、UMI风格交互、自我中心人类视频等。推理时,模型通过测试时计算采样动作候选,并利用去噪一致性和基于…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用
作者展示了如何在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用。此前的 Datasette Lite 使用 Web Workers,但无法执行 ` ` 标签中的 JavaScript。新方案由 Claude Opus 4.8 协助完成开发,解决了这一问题。作者已展示了基础的 ASGI FastCGI 演示和运行 Datasette 1.0a31 的演示,并计划后续将此方法应用于升级 Datasette Lite。
信息来源:Simon Willison 博客 · Claude
观点 / 方法精选
NVIDIA 或将于六月发布整合 Blackwell GPU 与 AI 单元的 ARM 笔记本芯片 N1X
NVIDIA、微软与 Arm 同步发布指向台北音乐中心的坐标,暗示 6 月 1 日发布会将有重大动作。此举被认为是 NVIDIA 与联发科合作的 ARM 笔记本芯片 N1X 的预告。该芯片整合了 CPU、基于 Blackwell 架构的 GPU 及 AI 单元,目标是使轻薄本具备接近 RTX 4070 的图形性能。这标志着 NVIDIA 的战略转变:从显卡供应商,转型为定义整机核心方案的提供商,将直接冲击 Intel、AMD 和高通在 PC 市场的地位。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · NVIDIA
观点 / 方法精选
随着成本飙升,美国企业开始对人工智能实施配给
由于运行和使用AI工具的成本持续飙升,美国企业正开始对人工智能的使用实施配给制。企业通过限制使用量、设置分层级审批流程等方式控制开支,以应对AI费用增长过快的问题。这种从广泛采用转向精细化管理的策略,标志着企业在AI应用上从追求速度转向注重成本效益。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
免费领取6个月ChatGPT Pro及AI工具思考
OpenAI为开源项目维护者提供福利,可免费领取6个月ChatGPT Pro(价值$1200),申请无硬性Star数要求,有项目链接即可。同时,文章引用讨论了AI工具的分类:一类是"agent型"(如Claude Code、Codex),可自主运行;另一类是"实习生型"(如Cursor),需人工决策,有助于使用者以术入道、培养判断力,但受限于需人在场。作者推荐了网易的UU远程工具,称其免费两年,支持4K 144帧无延迟连接Mac并可使用原生终端,解决了"实习生型"工具的地点…
信息来源:X:阿易 AI Notes (@AYi_AInotes) · OpenAI / ChatGPT / Claude
行业动态精选
AI 骗子正在创建虚假的黑人形象来销售 Shein 劣质商品
有卖家利用 AI 生成虚假的黑人形象,在 TikTok、Facebook 和 Instagram 上扮演手工制品创作者进行销售。例如一个名为 Aliyah 的 AI 生成形象,以带泪诉说的方式售卖所谓手工皮带扣,但该形象及其产品均为虚构。此类 AI 虚拟网红被用于推广通过代发货模式销售的批量生产品。
信息来源:The Verge:AI(RSS)
模型发布 / 更新精选
Nano Banana Pro与Nano Banana 2正式发布
ICYMI:Nano Banana Pro 【gemini-3-pro-image】 和 Nano Banana 2 【gemini-3.1-flash-image】 现已正式发布,可通过 Gemini API 投入生产使用。 查看这些优秀的社区示例,了解两个模型的实际能力 🧵
信息来源:X:Google AI for Developers (@googleaidevs) · Gemini
行业动态精选
xAI放弃JAX GPU转向自研训练框架
突发新闻:JAX NVIDIA GPU & XLA:GPU最大客户刚刚宣布已放弃JAX GPU,宁愿用Grok Build"氛围编程"一个C训练框架。据报道xAI的JAX堆栈MFU低于10%。NVIDIA JAX团队过去两年全部主力996专注于支持xAI却失败了,我想他们现在可以休息并兑现期权了。
信息来源:X:SemiAnalysis (@SemiAnalysis_) · Grok / NVIDIA
产品发布 / 更新精选
ComfyUI现已支持OpenRouter模型直接调用
现在你可以直接在ComfyUI工作流中使用你的OpenRouter模型了! 【引用 @ComfyUI】:ComfyUI刚刚添加了@OpenRouter支持。 你不再局限于单一的大语言模型,现在可以直接在Comfy中访问20多个模型。 更多灵活性,更少摩擦,同样的工作流。 工作流链接在下方👇
信息来源:X:OpenRouter (@OpenRouter)
教程 / 实战精选
这个 skill 看着不错,可将文字、URL 或文章直接生成公众号首图、小红书图文卡、教程步骤卡等视觉物料,支持 28 种布局和 10 种主题。
claude-design-card 是一款专为中文内容创作者设计的 Skill。它能将文字、URL 或文章直接转化为可发布的视觉卡片,如公众号首图、小红书图文卡、教程步骤卡等,支持 28 种布局与 10 种主题。其核心价值在于自动化了"写完文章"后最繁琐的流程:自动提炼重点、选择版式、生成 HTML 并截图成 PNG,替代了以往手动使用 Figma 或 Canva 等工具的步骤。该工具开源,适合经常撰写相关内容的创作者尝试。
信息来源:X:洪明 (@hongming731) · Claude
产品发布 / 更新精选
Codex可自主管理对话线程与并行任务
Codex用于管理Codex界面: 【引用 @guinnesschen】:如果你厌倦了管理Codex对话线程,就让Codex自己管理自己吧!Codex现在可以创建对话线程、搜索它们、整理它们、固定重要的线程,并为并行任务启动工作树。
信息来源:X:Greg Brockman (@gdb)
模型发布 / 更新精选
Liquid AI 公布了在 38T 数据集上训练的 8B-A1B MoE 模型
Liquid AI 发布了其 LFM2-5 系列的 8B-A1B 模型,该模型采用混合专家(MoE)架构,在包含 38T token 的数据集上训练完成。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
ChatGPT长对话新增目录导航功能
为每个始于"就问一句"却演成长篇大论的ChatGPT对话:目录功能现已上线。 适用于包含5条以上回复的对话。
信息来源:X:Greg Brockman (@gdb) · ChatGPT
产品发布 / 更新精选
ChatGPT对话目录功能现已上线
对于每个始于"就问一件事"却演变成完整长篇的ChatGPT对话:目录功能现已推出。 适用于包含5条以上回复的对话。
信息来源:X:ChatGPT (@ChatGPTapp) · ChatGPT
产品发布 / 更新精选
v2.1.157 更新
此版本主要改进了插件系统,现可自动加载 `.claude/skills` 目录中的插件,并通过 `claude plugin init` 创建;`/plugin` 命令增加了自动补全。`claude agents` 现在会应用 `settings.json` 中的 `agent` 字段,并支持 `--agent` 参数覆盖。更新修复了多个具体问题,包括处理不可用图片导致的崩溃、在 tmux 中的剪贴板复制失效(2.1.153 回归)、后台会话恢复后日期不正确等。此外,优化了…
信息来源:Claude Code:GitHub Releases(RSS) · Claude / Cursor
产品发布 / 更新精选
Runway API持续扩展模型与端点支持
我们持续为 Runway API 添加新模型和端点,以便您能将最佳生成能力直接集成到应用、产品和平台中。通过 Runway API,您可以在一个地方获得所需的所有模型,包括 Seedance 2.0、GPT Image 2、HappyHorse 1.0、Nano Banana Pro、Magnific Precision Upscaler V2 等更多内容。请通过下方链接开始使用。
信息来源:X:Runway (@runwayml) · GPT
模型发布 / 更新精选
OpenAI推出实时翻译模型,支持70+语言输入
OpenAI 实时翻译功能--使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但特定用例需要专用模型。 我们正在智能眼镜上运行此功能。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
观点 / 方法精选
参与我们的 I/O 2026 测验:该测验由 Google AI Studio 氛围编程生成
Google 使用其开发工具 Google AI Studio,通过氛围编程(vibe coding)方式,创建了一个关于 Google I/O 2026 主要公告的在线测验。
信息来源:Google Blog:AI(RSS)
产品发布 / 更新精选
Gemini Omni可将草图变为现实
Gemini Omni甚至能将简单的草图变为新的现实。 在Gemini应用中亲自尝试。上传一段有人画圆的视频,然后输入这个提示词:当我画完这个圆时,它变成了___。
信息来源:X:Gemini (@GeminiApp) · Gemini
产品发布 / 更新精选
Opus 4.8支持对话中途添加系统指令
使用 Opus 4.8,您可以在对话中途添加系统指令,而不会破坏提示词缓存。 更多缓存命中意味着您的 API 请求成本更低、延迟更小。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
产品发布 / 更新精选
Codex Windows端重大升级,支持计算机操作与移动端协同
Codex 用户在 Windows 上迎来重大升级: 现在计算机操作功能已在 Windows 上可用,Codex 可以在你的 Windows 电脑上执行操作。 同时,ChatGPT 移动应用中的 Codex 也支持 Windows,让你可以随时随地启动、审查和引导任务,而工作则在你的 Windows 机器上继续进行。 这是一次早期体验,但我们正在努力提供更多方式,让你无论身在何处都能保持工作推进。
信息来源:X:Greg Brockman (@gdb) · ChatGPT
产品发布 / 更新精选
Codex现已支持Windows端计算机使用功能
Windows用户,这条消息是给你的。 计算机使用功能现已在Windows上可用,因此Codex可以在你的Windows电脑上执行操作。 通过ChatGPT移动应用中Codex的Windows支持,你可以在工作继续在Windows电脑上进行时,随时随地启动、审查和引导任务。 这是一项早期体验,但我们正在努力提供更多方式,让你的工作无论身在何处都能持续进行。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT
产品发布 / 更新精选
OpenRouter融合预算模型性能超越GPT-5.5与Claude Opus 4.7
一组预算模型通过OpenRouter平台进行模型融合,在包含100个复杂研究任务的评估中,得分超过了GPT-5.5与Claude Opus 4.7。
信息来源:OpenRouter:Announcements(RSS) · GPT / Claude
观点 / 方法精选
当公司过于"AI上瘾"时会发生什么?
Box创始人Aaron Levie指出,决定用AI替代员工的人往往最不了解工作的实际内容,他将此称为"AI psychosis"。ClickUp近期为部署AI智能体裁员22%即是一例。2026年的科技行业裁员规模已接近2025年全年。
信息来源:TechCrunch:AI(RSS)
模型发布 / 更新精选
Gemini Omni 与 Gemini 3.5 的 11 个实战展示
Google 在 2026 年 Google I/O 大会上发布了新一代多模态模型 Gemini Omni 与 Gemini 3.5,并同步提供了 11 个视频,集中演示了这两款模型在实际场景中的能力。
信息来源:Google Blog:AI(RSS) · Gemini
观点 / 方法精选
亲测为实:难以置信的推理速度
Kog团队在标准数据中心GPU上实现了极高的单用户推理速度,在8× AMD MI300X GPUs上达到3,000 tokens/s,在8× NVIDIA H200上达到2,100 tokens/s。相比常规推理速度(约100-300 tokens/s),实现了10-30倍提升。其核心思路是将LLM解码视为内存流问题,通过协同设计monokernel、重建同步机制、针对性内存访问映射及采用延迟张量并行的Laneformer模型架构,消除了传统流程的阻塞点。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
论文研究精选
GPIC:大规模视觉生成基准数据集发布
我对这个适用于大规模生成模型新时代的视觉生成基准数据集感到非常兴奋!🤩
信息来源:X:Fei-Fei Li (@drfeifei, World Labs)
产品发布 / 更新精选
Replit Canvas:对话式设计与原型生成工具
你试过新的 Replit Canvas 了吗? - 探索多种设计方向 - 通过与设计框架对话来调整设计 - 设计 UI 原型并将其转换为应用 - 为社交媒体创建营销素材
信息来源:X:Replit (@Replit)
产品发布 / 更新精选
OpenRouter支持模型生成文件补丁
OpenRouter 现已支持 "apply_patch",这是一个服务器工具,允许任何模型通过 Responses API 使用 V4A diffs 提出文件编辑建议。 模型生成一个补丁(创建、更新或删除文件)。OpenRouter 在服务器端验证 diff 语法。
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新精选
xAI 发布 Grok Build 0.1 公测版
grok-build-0.1 现已通过 xAI API 提供公开测试版。 这是驱动 Grok Build CLI 的同一模型,擅长智能体编码。 定价为输入 $1/m,输出 $2/m,极具成本效益、智能且快速。
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
模型发布 / 更新精选
Qwen-VLA:迈向通用具身智能的统一动作框架
通义实验室提出Qwen-VLA,以Qwen3.5-4B视觉语言主干与1.15B参数DiT动作解码器构建统一视觉-语言-动作模型。通过文本到动作DiT预训练和本体感知提示,将操作、导航与轨迹预测统一在同一框架下,支持11种机器人平台。在5个仿真基准中,单一通用模型在3个上超越最佳专用模型;ALOHA真机in-domain成功率83.6%,OOD泛化76.9%,分别超越π0.5超35和40个百分点;DOMINO动态操作零样本达26.6%;VLN-CE导航R2R和RxR分别达57…
信息来源:公众号:通义实验室(千问) · Qwen
产品发布 / 更新精选
OpenRouter 推出 Guardrails:保护你的 AI 智能体、数据与成本
OpenRouter 发布 Guardrails 可配置安全与治理工具,支持预算执行、零数据保留、模型和提供商限制、提示词注入防御以及数据丢失防护,帮助用户保护 AI 智能体、数据与成本。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
OpenRouter Guardrails 发布:可配置安全与治理工具,保护 AI 智能体、数据与成本
OpenRouter 推出 Guardrails,一套可配置的安全与治理工具,支持预算执行、零数据保留、模型与提供商限制、提示词注入防御及数据丢失防护等策略,用于保护 AI 智能体、数据和成本。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
Guardrails:保护你的智能体、数据与成本
Guardrails 是一套可配置的安全与治理工具,提供预算执行、零数据保留、模型与提供商限制、提示词注入防御及数据丢失预防等功能,旨在保护智能体(Agents)、数据与控制成本。
信息来源:OpenRouter:Announcements(RSS)