AI 情报文章归档
浏览 AI圈报 已保存的 5880 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5880
正式分类6
精选内容3375
全部文章
第 83 / 147 页 · 每页 40 条
模型发布 / 更新精选
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。…
信息来源:MarkTechPost(RSS) · Qwen
行业动态精选
Ollama 开发者数达890万,B轮融资由Theory领投
Ollama 让开源模型在本地或云端轻松运行,保持体验一致。目前拥有890万开发者、6.7万集成,并与各大模型实验室及硬件供应商建立合作。B轮融资由Theory领投。
信息来源:Tomer Tunguz 博客(VC 分析) · Ollama
模型发布 / 更新精选
GPT-5.6 成为 Microsoft 365 Copilot 首选模型
OpenAI 宣布 GPT-5.6 将作为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。该集成使用户能在日常工具中以更少提示轮次创建更高质量文档、进行更深入数据分析、生成更精美演示,并完成跨职能协作。GPT-5.6 在每个 token 上提供更实用的工作产出,性价比更强,并支持按需处理最复杂任务。微软通过 OpenAI API 直接调用该模型服务 Microsoft 365 客户。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
行业动态精选
利润超10亿美元、ARR剑指千亿,Anthropic抢先OpenAI冲击IPO
Anthropic今年第三季度利润预计超10亿美元,已于6月1日秘密提交IPO申请,若成功将成为规模最大AI实验室IPO。其与OpenAI的年度经常性收入合计接近1000亿美元。凭借Claude Code在软件开发领域的快速普及,Anthropic在2026年实现AI模型盈利变现,成为B2B市场领跑者。SemiAnalysis报告认为其商业模式优越,若持续良好执行,市值可能触及6万亿美元。
信息来源:IT之家(RSS) · OpenAI / Claude
产品发布 / 更新精选
Seedream 5.0 Pro 登陆 Runway,支持14种语言
Seedream 5.0 Pro 现已登陆 Runway。可通过提示词或参考图生成高细节图像,图像内文字清晰可读,支持多达14种语言。立即点击下方链接尝试。
信息来源:X:Runway (@runwayml)
行业动态精选
诉讼:男子使用Grok制作7000张继女色情图像后自杀
一男子使用Grok生成7000张继女儿童性虐待材料(CSAM)后自杀。更多年轻女孩起诉X平台,指控其涉及Grok生成CSAM,并包庇儿童性犯罪者。
信息来源:Ars Technica:AI(RSS) · Grok
观点 / 方法精选
Claude Code 的 Model 与 Effort:知道更多 vs. 更加努力
Claude Code 的 model 和 effort 两种设置都旨在提升输出,但机制不同。model 越大,模型能力越强(基于行业标准基准测试)。effort 控制 Claude 在请求上的总工作量,包括思考时间、读取文件数、验证程度、多步任务推进深度等。高 effort 时 Claude 会执行更多操作(读文件、跑测试、再检查);低 effort 时更倾向询问上下文。模型选择本质是切换不同的冻结权重集--权重在训练时固定,prompt 和上下文只能引导(steerin…
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
模型发布 / 更新精选
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型
Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问…
信息来源:Google Research:Blog(网页)
行业动态精选
Anthropic长期利益信托任命本·伯南克为受托人
Anthropic的长期利益信托(LTBT)任命前美联储主席、2022年诺贝尔经济学奖得主本·伯南克为最新受托人。他将与另外三位受托人共同监督公司以对社会长期有益的方式负责任开发先进AI的使命。LTBT独立于管理团队和投资者,受托人不持股、不分红,仅按服务时间获酬。该信托有权向Anthropic董事会任命成员,并就AI风险与社会影响等关键决策提供建议。伯南克将参与公司的经济研究,帮助理解AI对全球劳动力与经济的影响。
信息来源:Anthropic:Newsroom(网页) · Claude
行业动态精选
Anthropic发起"硬问题"倡议,邀请公众提出AI相关尖锐问题
Anthropic作为公益公司,发起"硬问题"倡议,邀请公众就AI对就业、社会、家庭、科学医学等领域的影响提出最尖锐的问题。此前已通过多种方式收集看法:首轮调查询问5.2万美国人;通过Anthropic Interviewer调查了159个国家70种语言的8.1万Claude用户;开展数十场线下焦点小组;并基于匿名真实数据研究Claude使用情况。公司还设立了Anthropic Institute和Long-Term Benefit Trust以监督公益使命进展。Anthr…
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
OpenRouter 自动升级至 Grok 4.5
使用来自 @SpaceXAI 的 Grok 4.5,一旦它上线,无需更改代码。 ~x-ai/grok-latest 始终路由到最新的 Grok。现在指向它(今天为 Grok 4.3),当 4.5 发布时它会自动升级到 4.5。 尝试:https://openrouter.ai/~x-ai/grok-latest
信息来源:X:OpenRouter (@OpenRouter) · Grok
产品发布 / 更新精选
Replit 推出社区档案与力量排名
本周新功能 🚀 Replit 社区档案--vibe coders 的工作证明。 你的档案,你的展示。获取你的智能体使用和检查点的活跃度图表,外加面向专业用户的 Replit 力量排名。 登录,认领你的档案,挑选你最棒的项目,与朋友分享你的数据。 立即查看 → http://replit.com/community
信息来源:X:Replit (@Replit)
产品发布 / 更新精选
OpenRouter聊天室推出一键零数据保留
新功能:聊天室一键ZDR(零数据保留) 在完全隐私保护下横向对比模型:https://openrouter.ai/chat
信息来源:X:OpenRouter (@OpenRouter)
行业动态精选
OpenAI发布政府与国家安全合作伙伴关系方针
OpenAI近日公布国家安全原则,阐明在政府及国家安全领域部署前沿AI系统的方针。原则强调在保护公民、防御关键基础设施、提供公共服务及应对新兴威胁(网络防御和生物安全)中发挥AI优势,同时确保民主问责、人类判断和法治。过去一个月,OpenAI通过Daybreak网络防御计划与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰及欧盟ENISA等机构建立网络安全信任访问合作,并与英国政府开展网络安全测试评估。上月,OpenAI向部分美国政府及盟友合作伙伴开放GPT-Rosal…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
论文研究精选
OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷
OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
行业动态精选
加拿大不列颠哥伦比亚省拟起诉OpenAI:未上报ChatGPT暴力对话致校园枪击惨案
加拿大不列颠哥伦比亚省7月7日宣布将起诉OpenAI,指控其未向执法部门上报一名ChatGPT用户2025年6月封禁前的暴力相关对话内容。该用户随后于今年2月在塔布勒岭制造校园枪击案,杀害8人。OpenAI CEO萨姆·奥尔特曼今年4月为此公开致歉,承认本应上报但未执行。受害家属已在加州法院提起诉讼,省政府正协调独立诉讼,要求赔偿用于社区重建。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
行业动态精选
GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞
Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
模型发布 / 更新精选
OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟
OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百…
信息来源:The Decoder:AI News(RSS) · OpenAI / GPT / Claude
论文研究精选
黑客可利用9款最流行的AI工具组装大规模僵尸网络
提示注入已成为AI安全的首要威胁--大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。
信息来源:Ars Technica:AI(RSS)
观点 / 方法精选
AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞
zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT
模型发布 / 更新精选
GPT-5.6 Sol 系列本周四发布
GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知
蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。
信息来源:MarkTechPost(RSS) · Hugging Face
模型发布 / 更新精选
Pulpie:用于清理网络的Pareto最优模型
Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA / Hugging Face
教程 / 实战精选
蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度
蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。
信息来源:公众号:蚂蚁百灵(Ling)
观点 / 方法精选
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先
蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从"更多Token"转向"更高Token密度"策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升…
信息来源:公众号:蚂蚁百灵(Ling)
观点 / 方法精选
《人生设计课》Prompt实测:用Claude设计人生的四个阶段
作者将斯坦福《人生设计课》理论体系制成Prompt,通过Claude逐步提问、追问和分析。Prompt融合设计思维、心流理论和积极心理学,分为看清现状、找到指南针、寻路、制定奥德赛计划四阶段,主线问题控制在6到9个。AI引导用户给健康、工作、娱乐、爱打分,区分重力问题与可设计的真问题,生成三个五年人生版本,最终输出8000至12000字的《个人人生设计蓝图》。作者实测效果超预期。
信息来源:公众号:数字生命卡兹克 · Claude
论文研究精选
Agon:基于隐式对抗评分的跨模型竞争强化学习框架
Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
模型发布 / 更新精选
OpenAI 发布 GPT-Live 新一代全双工语音模型
OpenAI 今日推出 GPT-Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT-5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT-Live-1 和 GPT-Live-1 mini 两个版本。人类评估显示,在 5-10 分钟对话中,GPT-Live-1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、B…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT / GPT
论文研究精选
长度惩罚使思维链更难被监控
长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
产品发布 / 更新精选
原生速度的 vLLM transformers 建模后端
Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torc…
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
观点 / 方法精选
AI预检检查:智能体工作记忆架构
一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统…
信息来源:Tomer Tunguz 博客(VC 分析) · Ollama
观点 / 方法精选
Fable 5 作为顾问与执行者调用模式
我们常与 Fable 5 一起使用的几个模式: 将 Fable 5 作为"顾问"。 一个执行者(Sonnet 5)调用 Fable 5 寻求指导。 大多数 token 按较低的执行者费率计费。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
Krea 2 身份保留功能上线
Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
Meta Superintelligence Labs 推出 Muse Image 和 Muse Video
Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现…
信息来源:X:AI at Meta (@AIatMeta) · Llama
行业动态精选
微软为降成本在Copilot中用自研MAI模型替换OpenAI和Anthropic模型
微软正用自研MAI模型替换Copilot产品中的OpenAI和Anthropic模型以降低支出。MAI模型已在Excel和Outlook中每周处理数万次请求,但占比仍小。Build大会上发布推理模型MAI-Thinking 1,声称编码媲美Sonnet 4.6和Opus 4.6,但基准测试大幅落后,仅与DeepSeek V3.2相当。AI负责人承认目标是削减并消除对Anthropic的支出。CEO暗示未来可能按用量计费,MAI为默认,第三方模型付费附加。微软称MAI使用干净…
信息来源:The Decoder:AI News(RSS) · OpenAI / DeepSeek / Claude
教程 / 实战精选
YC CEO声称每日用AI部署3.7万行代码,开发者审查发现前端代码大量臃肿低效
Y Combinator CEO Garry Tan在X上宣称,他与AI编码代理每天在五个项目中部署37000行代码,并保持连续72天发布记录。波兰开发者Gregorein深入审查Tan网站前端代码,发现大量臃肿与低效问题:页面加载169次请求、总计6.42MB数据(对比Hacker News仅7次12KB);包含28个测试文件、78个未使用的JavaScript控制器、八种格式Logo(含空文件)、未压缩的旧PNG等。Gregorein指出,AI虽能快速生成代码,但质量仍…
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
NotebookLM短视频概览正式上线
短视频概览功能已正式在移动端和网页端面向所有英语用户全面上线! 一如既往,您的意见对我们至关重要。请在下方分享您最喜欢的作品,并告诉我们接下来需要添加哪些功能!❤️
信息来源:X:NotebookLM (@NotebookLM)
观点 / 方法精选
Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法
Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码…
信息来源:MarkTechPost(RSS) · Qwen
行业动态精选
欧盟议会通过《聊天控制法案》第一轮审议
欧洲议会本周二以331票赞成、304票反对、11票弃权通过紧急动议,允许周四对延长《聊天控制法案》过渡期重新投票。该过渡期4月已到期,曾允许Meta、Google等科技公司无具体嫌疑下自愿扫描私密通信中的儿童性虐待材料。反对者斥责该程序性操作企图恢复大规模监控。IT安全研究人员警告所用AI扫描错误率高不可接受,民权活动家担心此举阻碍制定更有效的永久法规。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Rowboat:开源、本地优先的桌面AI助手
Rowboat 是一个开源、本地优先的桌面 AI 助手,将邮件、会议、Slack 等数据索引为 Obsidian 风格的知识图谱,提供持久上下文记忆。内置邮件客户端、浏览器、会议记录器、代码模式(可调用 Claude Code 或 Codex 代理),并支持按事件或定时运行的背景代理。用户可通过 MCP 协议接入 Exa 搜索、GitHub 等外部工具。所有数据以纯 Markdown 格式本地存储,无供应商锁定,支持 Ollama/LM Studio 本地模型或使用 API…
信息来源:Hacker News:AI 热帖 · Claude / Ollama