AI 情报文章归档
浏览 AI圈报 已保存的 5711 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5711
正式分类6
精选内容3361
全部文章
第 106 / 143 页 · 每页 40 条
观点 / 方法精选
特斯拉 FSD 安全性宣称遭质疑
特斯拉声称其全自动驾驶软件(FSD)安全性最高可达人类的10倍,但路透社调查发现此数据经不起推敲。参与训练FSD的员工表示该技术远未成熟,其安全演示高度依赖人工。统计方法被11位交通安全研究人员指出存在缺陷,例如与更广泛的联邦事故数据进行不恰当比较。相比之下,竞争对手Waymo采用了更严谨的统计方法。目前,特斯拉FSD仍需驾驶员主动监督,安全部署可能还需数年。
信息来源:IT之家(RSS)
行业动态精选
三星电子业内率先出样 HBM4E 内存
信息来源:IT之家(RSS)
模型发布 / 更新精选
阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型
阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ2-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode …
信息来源:公众号:阶跃星辰(Step) · Claude
教程 / 实战精选
PyTorch 性能分析系列(一):torch.profiler 入门指南
本文是 PyTorch profiling 系列的开篇,从最简单的矩阵乘法加偏置操作出发,逐步讲解如何使用 `torch.profiler` 进行性能分析。涵盖 profiler 设置、导出统计表格与 Chrome trace、解读 CPU 和 GPU 活动的时序关系,以及 `torch.compile` 对底层 CUDA kernel 调用链的影响。实验基于 NVIDIA A100-SXM4-80GB GPU 运行,面向基本掌握 PyTorch 但缺乏 profiling…
信息来源:Hugging Face:Blog(RSS) · NVIDIA / Hugging Face
观点 / 方法精选
技能提炼
"技能提炼"是一种知识转移方法,由前沿大模型(如 Opus 4.7、GPT-5.1、Gemini 3 Pro)负责撰写并优化标准化的 SKILL.md 流程文件。然后,本地运行的小模型(如 Qwen 35B、Gemma 26B)直接执行这些文件。此过程不同于压缩模型权重的知识蒸馏、训练权重的指令微调或检索事实的 RAG,其核心是提取并转移操作流程,让小模型按步骤执行,从而形成前沿模型作教师、小模型作执行者的循环。
信息来源:Tomer Tunguz 博客(VC 分析) · GPT / Qwen / Gemini
产品发布 / 更新精选
llm-anthropic 0.25.1
llm-anthropic 发布 0.25.1 版本。主要更新包括:新增 Claude Opus 4.8 (`claude-opus-4.8`) 模型;为账户启用了该功能的组织新增了 `-o fast 1` 选项以使用快速模式;调整了各模型的默认 `max_tokens` 值,使其直接使用模型的最大输出长度,而非固定的 8,192。
信息来源:Simon Willison 博客 · Claude
行业动态精选
IT早报 0529:估值 450 亿美元,曝大基金领投 DeepSeek 首轮融资;比亚迪发 4nm 璇玑 A3 芯片并推城市领航兜底;京沪联手指导美团、淘宝、京东三大外卖平台…
DeepSeek 获国家集成电路产业投资基金(国家大基金)领投的首轮融资,投前估值 450 亿美元。豆包官方就"新手父母听建议每顿只喂60ml奶"一事作出回应,称其建议符合国家喂养指南,指出原报道存在上下文缺失。微信 Win / Mac 4.1.10 正式版发布,新增"边写边译"功能。
信息来源:IT之家(RSS) · DeepSeek / 豆包
产品发布 / 更新精选
别只看基准测试,要看全面表现
不要只依赖基准测试;要看全面情况! 试试我们的新比较页面,它还能让你可视化模型性能:https://openrouter.ai/compare/openai/gpt-5.5/anthropic/claude-opus-4.7/anthropic/claude-opus-4.8
信息来源:X:OpenRouter (@OpenRouter) · OpenAI / GPT / Claude
行业动态精选
萨姆·阿尔特曼和达里奥·阿莫代伊都纷纷收回了关于AI将引发就业危机的预测
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
LLMs相信虚假陈述,即使明确警告也无效
微调测试显示,大语言模型存在一种偏见,即倾向于自信地将虚假陈述表述为真实,即使明确告知其陈述为假。
信息来源:Ars Technica:AI(RSS)
产品发布 / 更新精选
Replit Canvas:智能体设计工具发布
最好的设计工作不会在聊天框里发生。你需要空间来探索想法、创建变体并进行迭代。 认识新的 Replit Canvas。 你的智能体设计工具,用于构建精美的网站、应用、营销资产等。
信息来源:X:Replit (@Replit)
产品发布 / 更新精选
MiniMax M2.7 免费智能体编程限时开放
在 @OpenHandsDev 上使用 MiniMax M2.7 进行免费智能体编程? 是的,请给我!限时提供 ⚡👀
信息来源:X:MiniMax (@MiniMax_AI)
行业动态精选
Anthropic 融资 650 亿美元,估值逼近 1 万亿,IPO 在即
Anthropic 完成 650 亿美元的 Series H 融资,投后估值达 9650 亿美元。这可能是这家 AI 公司在备受期待的 IPO 前的最后一轮私募融资。
信息来源:TechCrunch:AI(RSS) · Claude
论文研究精选
hexoai开源SIA框架:AI智能体实现递归自我改进
hexoai开源了SIA(自我改进AI)框架。该框架展示了AI智能体不仅能优化其外部工作流(harness),还能通过任务反馈直接更新自身的模型权重,从而在领域知识和能力上实现自主提升,而非仅依赖人类提供的提示或工具改进。论文报告显示,SIA在LawBench基准上性能提升56.6%,在GPU kernels运行上耗时减少91.9%,在单细胞RNA去噪任务中相比基线提升502%。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新精选
Claude Code v2.1.154 发布:新增 Opus 4.8 与动态工作流
Claude Code 更新至 v2.1.154 版本,正式引入 Opus 4.8 模型。新功能包括"动态工作流",可通过 `/workflows` 指令让 Claude 在后台编排数十到数百个 AI 智能体协同处理复杂任务。Opus 4.8 的快速模式现已可用,成本降低为 2 倍标准费率可实现 2.5 倍速度提升。其他更新有:精简系统提示词成为默认设置(除 Haiku、Sonnet 及 Opus 4.7 及更早版本外),优化多选题决策逻辑,简化 `/simplify` 命…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Anthropic 发布 Opus 4.8 并推出新型"动态工作流"工具
Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为"Dynamic Workflows"的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。
信息来源:TechCrunch:AI(RSS) · Claude
观点 / 方法精选
LMSYS与Intel合作通过异构CPU+GPU EPD架构提升视觉语言模型服务性能
LMSYS团队(Intel与SGLang)通过Dynamo和SGLang框架,为视觉语言模型(VLM)启用了异构编码-预填充-解耦(EPD)架构。该方案将视觉编码任务从GPU卸载至CPU(如Intel Xeon 6747P),与GPU协同工作。在Qwen3-VL-8B-Instruct模型的测试中,采用4 CPU + 1 GPU作为编码器、4 GPU作为预填充解码器(能力比R=12)的配置,在ISL/OSL 128/256、1080p 8张图像的负载下,实现了P99 TTF…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Qwen
模型发布 / 更新精选
SenseNova信息图表生成模型升级:文本、布局与图表质量全面增强
SenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
教程 / 实战精选
社区如何利用Tunix和TPU训练Gemma学会"思考"
Google在Kaggle举办的Tunix黑客马拉松,挑战开发者利用TPU和有限算力,将小型基础模型转变为通用推理引擎。获胜团队通过多阶段后训练流程实现了这一目标,该流程结合了监督微调(SFT)与GRPO、SimPO等先进对齐技术。比赛结果表明,社区能够借助开源资源成功训练出高能力的结构化推理模型。
信息来源:Google Developers Blog(RSS)
产品发布 / 更新精选
Sesame,这家由Oculus创始人创办的对话式AI初创公司,发布其iOS应用
由Oculus创始人创办的AI初创公司Sesame发布了其iOS应用,该应用将对话式AI智能体带给公众。应用提供更自然的来回交互体验,设计上区别于传统聊天机器人,旨在让用户感觉更像在和真人对话。
信息来源:TechCrunch:AI(RSS)
模型发布 / 更新精选
MiMo-V2.5现已登陆OpenCode限时免费
MiMo-V2.5现已在OpenCode上线--限时免费。🎉 【引用 @opencode】:OpenCode x MiMo V2.5 - 限时免费 1M上下文 • 推理 • 文本 • 图像
信息来源:X:小米 MiMo (@XiaomiMiMo)
模型发布 / 更新精选
商汤发布信息图生成模型升级,增强多项核心能力
商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
产品发布 / 更新精选
Perplexity Computer现已集成微软Office套件
Perplexity Computer现已登陆Microsoft Excel、Word、PowerPoint和Outlook。 您可以在应用程序的侧边栏中直接使用Computer来协调工作,起草文档、建模、制作演示文稿并处理电子邮件。 现已推出:https://www.perplexity.ai/hub/products/integrations/microsoft
信息来源:X:Perplexity (@perplexity_ai)
观点 / 方法精选
OpenRouter 支持模型现可选 Flex 与 Priority 服务层级
提示:您可以为支持的模型(OpenAI、Google Vertex 等)使用 Flex 和 Priority 层级。 定价信息请查看各模型页面。文档:https://openrouter.ai/docs/guides/features/service-tiers
信息来源:X:OpenRouter (@OpenRouter) · OpenAI
行业动态精选
OpenRouter 获得1.13亿美元B轮融资
AI模型聚合平台OpenRouter宣布完成1.13亿美元B轮融资。本轮融资由CapitalG领投,NVentures、ServiceNow Ventures等多家机构参投,现有投资者Andreessen Horowitz与Menlo Ventures也参与了本轮融资。
信息来源:OpenRouter:Announcements(RSS)
行业动态精选
OpenRouter 完成 1.13 亿美元 B 轮融资
OpenRouter 宣布获得 1.13 亿美元 B 轮融资,由 CapitalG 领投,NVentures、ServiceNow Ventures 等多家机构参投,现有投资者 Andreessen Horowitz 和 Menlo Ventures 继续跟投。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
发布 Search Toolkit
Mistral AI 发布了 Search Toolkit 的公共预览版。这是一个用于构建 AI 应用生产级搜索管道的可组合框架。该框架旨在解决团队在搭建搜索基础设施时,因数据摄取、检索和评估工具分散而耗费过多工程时间的问题。Search Toolkit 将这三者整合到单一框架与共享接口中,使团队能更专注于提升搜索质量。该工具开源,可部署在云端、本地或边缘环境,并支持企业搜索、RAG 等多种检索场景。
信息来源:Mistral AI:News(网页) · Mistral
行业动态精选
DeepSeek计划在完成融资后立即申请科创板IPO
独家:DeepSeek计划在完成当前约500亿美元(3500亿人民币)融资轮后,立即申请科创板(A股)IPO。 来源:参与本轮融资的一位大型基金经理。
信息来源:X:X.PIN (@thexpin) · DeepSeek
教程 / 实战精选
pgvector驱动的语义、混合、稀疏与量化向量搜索系统构建编码指南
本教程在Google Colab中构建一个完整的pgvector实验环境,展示PostgreSQL如何作为向量数据库服务于现代AI应用。内容涵盖安装PostgreSQL、编译pgvector扩展、通过Psycopg建立连接,并注册向量类型以实现与Python的平滑集成。最后使用SentenceTransformers创建并存储嵌入向量。
信息来源:MarkTechPost(RSS)
产品发布 / 更新精选
PilotDeck 开源:以 WorkSpace 为核心的智能体操作系统
清华大学 THUNLP 实验室、面壁智能、OpenBMB 与 AI9stars 联合研发并开源的智能体操作系统 PilotDeck,以 WorkSpace(工作舱)替代传统对话框,每个工作舱拥有独立文件系统、记忆和技能,实现项目隔离。三大核心能力:记忆白盒化,全链路可见可控,支持一键修改和回滚;智能路由,自动识别任务难度动态分配模型,开启后成本节省近 70%,复杂任务仅用 1/6 成本即可反超顶级模型方案;Always-on 常驻任务,AI 主动发现并持续推进工作。支持端云…
信息来源:公众号:面壁智能(MiniCPM)
观点 / 方法精选
英伟达推出 AI 框架 Polar,让 Codex 跑分暴涨 594.74%
英伟达研究团队开源了智能体强化学习框架 Polar。该框架无需重写现有智能体执行框架(如 Codex CLI、Claude Code、Qwen Code、Pi),通过在模型 API 边界放置智能体来接入 GRPO 训练。实验显示,基于 Qwen3.5-4B 模型,Polar 将 Codex 在 SWE-Bench Verified 上的 pass@1 分数从 3.8% 提升至 26.4%(增涨 594.74%)。效率上,其 prefix_merging 技术将训练步骤从 1…
信息来源:IT之家(RSS) · Qwen / Claude / NVIDIA
观点 / 方法精选
人民日报专访华为何庭波:今年秋季的新麒麟手机芯片,性能等相比去年是"跳跃性"提升
华为何庭波提出半导体新演进路径"韬(τ)定律",以"时间缩微"(如逻辑折叠)替代"几何缩微"作为新指导原则。她表示,过去6年华为已基于此自主研发381款芯片。今年秋季将发布新的麒麟手机芯片,这是首个完整的"韬芯片",其性能、集成度相比去年是"跳跃性"提升。
信息来源:IT之家(RSS)
产品发布 / 更新精选
Claude Code v2.1.153 版本更新
Claude Code 发布 v2.1.153 版本。主要新增 `skipLfs` 选项以跳过 Git LFS 下载;优化了 `claude agents` 的自动补全建议和 PR 列显示格式。本次更新修复了大量问题,包括:MCP 服务器的连接与重连、子代理的配置策略与严格模式行为、后台会话的管理与权限提示(如恢复、输入响应、临时文件处理),以及跨 macOS/Windows/VSCode 平台的稳定性。此外,还修复了 Windows 更新回滚、内存占用、会话恢复等多个具体…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
论文研究精选
恢复策略引发的错误:鲁棒GUI智能体的基准测试与轨迹合成
针对GUI智能体缺乏从自身错误中恢复能力的问题,本研究提出了GUI-RobustEval基准测试和RoTS轨迹合成框架。GUI-RobustEval包含1216个可执行测试用例,系统评估智能体在多种错误模式下的恢复能力。RoTS框架通过基于树的流程合成了80万条高质量数据。在此基础上训练的RoTS-7B和RoTS-32B模型,在GUI-RobustEval及传统基准上均获得显著提升。其中RoTS-32B在OSWorld上取得了47.4%的成功率和33.8%的All-Pass…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
WorldMemArena:通过行动-世界交互循环评估多模态智能体记忆
针对现有基准无法精确诊断多模态智能体记忆在动态环境中的具体失败阶段,研究提出了"行动-世界交互循环"记忆模型,并构建了WorldMemArena基准。该基准包含400个多会话多模态任务,涵盖"终身进化"和"智能体执行"两类场景,支持对记忆写入、维护、检索和使用的阶段级评估。研究首次对长上下文、RAG等手工设计系统与基于框架的记忆智能体进行直接比较,发现记忆写入与存储质量的提升不直接带来性能改善,且多模态记忆在利用视觉证据及跨领域稳定性上仍存在挑战。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Qwen-VLA:统一跨任务、环境与机器人形态的视觉-语言-动作建模
Qwen-VLA是一个统一的具身基础模型,将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现,使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台,引入了感知载体感知的提示条件机制,并将操作、导航与轨迹预测统一到一个框架中。实验显示,Qwen-VLA-Instruct在多个基准上表现优异,例如在LIBERO达到97.9%,在真实世界ALOHA实验中平均分布外成功率为76.…
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
模型发布 / 更新精选
Grok Build 0.1 on API
xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。
信息来源:xAI:News(网页) · Grok
论文研究精选
彩色噪声扩散采样
扩散模型的生成轨迹具有频谱偏差,早期处理低频全局结构,后期处理高频细节。传统随机微分方程求解器在整个过程中均匀注入白噪声,能量分配效率低。本研究提出彩色噪声采样(CNS),一种免训练的即插即用采样器。它通过动态、随时间和频率调整的噪声调度,更高效地将能量分配给尚未解析的频段。在SiT、JiT、FLUX等架构上的实验表明,CNS作为推理时的替换采样器显著提升了生成质量:在ImageNet-256上,无引导FID在SiT-XL/2上从8.26降至6.27,在JiT-B/16上从…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
AI智能体时代下的安全变革
Lemonade的CISO Jonathan Jaffe探讨了AI智能体时代的安全新挑战。他指出,AI对攻击者和防御者同样强大,但可被利用的漏洞窗口正在缩小,因为AI能更快地生成、审查和修补代码。为此,安全团队正向工程团队转型,例如Lemonade的安全部门均由工程师组成,并构建了包含智能体的内部AI平台。同时,每个智能体(单个终端上可能运行200到10000个)都需要被赋予身份,并在操作点由策略进行更复杂的管控,这超越了当前身份与访问管理系统的能力。
信息来源:Tomer Tunguz 博客(VC 分析)
产品发布 / 更新精选
Gemini Omni轻松转换视频视觉风格
使用 Gemini Omni 轻松将您的视频转换为新的视觉风格。 只需上传视频或照片,并要求 Gemini 为您的最终输出应用某种外观或风格。
信息来源:X:Gemini (@GeminiApp) · Gemini