AI 情报文章归档
浏览 AI圈报 已保存的 5825 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5825
正式分类6
精选内容3375
全部文章
第 87 / 146 页 · 每页 40 条
论文研究精选
OpenAI 报告:绘制欧洲 AI 劳动力机遇版图
OpenAI 发布新报告,分析 AI 对欧盟就业的影响,划定哪些职业面临自动化、增长或工作流程变化。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
行业动态精选
SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元
SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外,SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达 1100 万亿韩元(约 4.84 万亿元人民币)。
信息来源:IT之家(RSS)
观点 / 方法精选
分享两个Vibe Coding必备的实用Prompt:第一性原理与对抗式审查
作者分享Vibe Coding中两个关键Prompt:一是"从第一性原理出发",强制AI跳出类比推理,从基本事实重新推导本质,曾帮作者发现AIHOT抓取海外信源的底层流量路由隐患并彻底重构;二是"对抗式审查",让AI站在恶意用户角度攻防式审查代码,检出OOM死循环、未来时间污染等手工难发现的BUG。两个Prompt形成生成与验证闭环,使纯Vibe Coding项目AIHOT最近一周请求量超千万次。
信息来源:公众号:数字生命卡兹克
观点 / 方法精选
Anthropic:当AI成本超过工程师薪酬
Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。
信息来源:Tomer Tunguz 博客(VC 分析) · Claude
论文研究精选
Agents-A1:35B MoE 智能体模型通过扩展 horizon 达到万亿参数级性能
研究人员提出 Agents-A1,一个 35B 参数的 Mixture-of-Experts 智能体模型,通过扩展智能体 horizon(长轨迹与异构能力两个视角)达到万亿参数模型性能。团队构建了长 horizon 知识-行动基础设施,生成平均 45K token 的智能体轨迹,并采用三阶段训练:全领域监督微调、领域级教师模型训练、多教师领域路由在线蒸馏(含显著词汇对齐)。对比万亿参数模型 Kimi-K2.6 和 DeepSeek-V4-pro,Agents-A1 在 SE…
信息来源:HuggingFace Daily Papers(社区热门论文) · DeepSeek / Kimi / Hugging Face
观点 / 方法精选
Boris Cherny:AI时代产品角色演变的五种原型
Boris Cherny以Anthropic的Claude Code团队为例,归纳出五种未来产品角色:1)Prototyper(快速产出新想法);2)Builder(将原型转化为生产级产品);3)Sweeper(清理UI、简化代码、优化性能);4)Grower(迭代提升产品市场契合度);5)Maintainer(维护成熟系统的安全可靠与高效)。多数人覆盖2-3个角色,且角色不绑定岗位功能。健康团队需根据产品阶段混合配置:新产品/预PMF侧重1+2+3;增长期/已找到PMF侧…
信息来源:X:Boris Cherny (@bcherny) · Claude
行业动态精选
美国限制准入后,奥地利游说欧盟接纳 Anthropic 落户
奥地利数字国务秘书 Alexander Pröll 近日致信欧盟委员会执行副主席 Henna Virkkunen,建议欧盟考虑在境内设立并参与 Anthropic 的战略布局,以对抗美国限制外国人使用其最先进 AI 模型的做法。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
观点 / 方法精选
Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度
开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotro…
信息来源:Nathan Lambert:Interconnects(RSS) · DeepSeek / Qwen / GLM
产品发布 / 更新精选
Wayfinder Router:在本地和托管的大语言模型之间进行确定性查询路由
Wayfinder Router 通过分析提示词的结构(长度、标题、列表、代码)和措辞(证明、数学、硬约束),在微秒级完成路由决策,完全离线且无需调用其他模型。默认仅使用结构特征,词汇线索因盲测未泛化而默认为关闭。对比依赖模型调用的路由器(如 RouteLLM、NotDiamond),它避免了延迟、成本和随机性。用户可在自有数据上校准评分阈值。支持任何 OpenAI 兼容 API(含 Ollama、Anthropic、Groq、vLLM 等),可自托管。提供终端和网页演示(…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · OpenAI / Claude / Ollama
论文研究精选
From Brain Waves to Words: Brain2Qwerty Offers a New Path to Communication Without Surgery
信息来源:Meta AI:Blog(网页) · Llama
产品发布 / 更新精选
Claude 在 Microsoft Foundry 正式可用
从今天起,Claude 模型在 Microsoft Foundry 上正式可用,托管于 Azure 环境,运行在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Claude Haiku 4.5,通过 Messages API 调用,支持提示缓存和扩展思考。用户可选择推理处理位置,包括美国数据区域,由 Anthropic 负责推理运营。Azure 用户可使用现有身份验证、计费与治理控制,并获得统一账单;符合条件的 Enterprise A…
信息来源:Claude:Blog(网页) · Claude / NVIDIA
产品发布 / 更新精选
为 Amazon Bedrock 和 Google Cloud 推出的 Claude apps gateway
Anthropic 今日推出 Claude apps gateway,一个自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。它作为单个无状态容器部署于 Linux,后端使用 PostgreSQL,提供企业级 SSO 登录(通过 OIDC 对接 Google Workspace、Microsoft Entra ID、Okta 等)、集中策略管理、角色权限、路由(支持故障转移)以及按日/周/月、按组织/群组/…
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
Grok 4.5,基于我们的1.5T V9基础模型,并在补充训练中加入Cursor数据,现已在SpaceX和Tesla进入私测。初步评估显示其性能接近,或许超越Opus。 强化学习仍在持续显著改进模型,Grok Build工具链也在日益完善。 所有参与者的出色工作! 今年,@SpaceX 将每月发布完全从头训练的新模型。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok / Cursor
论文研究精选
仅有三个AI模型在500天创业测试中盈利超过起始资本
普林斯顿大学推出CEO-Bench基准测试,让AI智能体在模拟环境中运营订阅软件公司NovaMind 500天,起始资金100万美元。14个测试模型中,仅Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中超过起始资本。一个不调用语言模型的简单规则启发式方法通过固定定价、配额和针对性开发达到1576万美元,超越除上述三款外的所有模型。多数模型无法保持连贯策略,在模拟结束前破…
信息来源:The Decoder:AI News(RSS) · GPT / Claude
模型发布 / 更新精选
新浪开源VibeThinker-3B:推理可压缩,事实知识不能
新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200-333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出"参数压缩-覆盖假说":逻辑推理依赖少数可压缩模式,而广泛世界知识…
信息来源:The Decoder:AI News(RSS) · GPT / DeepSeek / Qwen
产品发布 / 更新精选
阿德拉菲尼尔:仅在AI agent工作时阻止Mac睡眠的菜单栏工具
Adrafinil 是一款 macOS 菜单栏应用,仅在 Claude Code、Codex、Cursor、Gemini CLI、Aider、Hermes、OpenCode、Cline、Pi 等 9 种 AI coding agent 持有活跃会话时阻止系统睡眠(包括合盖睡眠)。无 agent 工作时,合盖后 Mac 正常睡眠。它通过各 agent 的钩子系统调用 CLI,往返延迟低于 50ms,支持引用计数断言、热切出(温度阈值强制释放)、空闲释放及进程嗅探。需要 mac…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude / Gemini / Cursor
观点 / 方法精选
四大顶级AI对决《文明VI》:Claude核平法国仍输,暴露感知与执行短板
英国前首相府数据科学家Liam Wilkinson搭建76个MCP工具,将Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro等四个模型放入《文明VI》进行23场对局。Claude扮演葡萄牙时,因法国文化胜利逼近,花50回合研发核弹核平图卢兹,但法国最终以外交胜利获胜。Wilkinson发现:AI主动检查全局状态仅占1-2%(感知盲区),计划后10回合内执行率仅48-66%(知行差距)。结论是智商非瓶颈,感知与执行才是关键。
信息来源:IT之家(RSS) · GPT / Claude / Gemini
论文研究精选
OSWorld2.0:长时域真实世界计算机使用工作流基准
OSWorld2.0 发布,包含108个长时域计算机使用工作流,覆盖日常与专业任务。每项任务用户中位数约1.6小时完成,Claude Opus 4.7(最大思考)平均需318次工具调用(OSWorld 1.0约30次)。基准聚焦流交互、动态环境、跨源推理、隐式状态推断、视觉空间精度等真实挑战。任务基于真实输入工件和状态化用户档案,附安全报告。500步二元完成指标下,Claude Opus 4.8(最大思考+批量调用)得分最高仅20.6%(部分54.8%);GPT-5.5更省…
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Claude / Hugging Face
行业动态精选
SpaceX 注册 SpaceXAI 商标,将合并 xAI
消息:SpaceX 刚刚注册了"SpaceXAI"商标。 埃隆·马斯克表示 xAI 将解散,不再作为独立公司,因此它将只是 SpaceXAI,SpaceX 的 AI 产品。
信息来源:X:cb_doge (@cb_doge) · Grok
论文研究精选
DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60-85% 和 57-78%。离线测试中,接受长度比 Eagle3 高 26-31%,比 DFlash 高 16-18%。配套 DeepSpec 训练代码库采用 …
信息来源:MarkTechPost(RSS) · DeepSeek
观点 / 方法精选
一次失败的(民族国家?)攻击的剖析
作者收到伪装成新加坡VC Lua Ventures的虚假面试邮件,要求完成一个TypeScript仓库的"测试"。作者将仓库交给Claude扫描,在`typescript+5.9.2.patch`中发现base64混淆载荷,该载荷在`patch-package`安装时触发,向`~/.cache-`等目录写入`payload.js`和`mutex.js`,构成后门(命名PinpinRAT)。攻击者使用虚构身份和空洞LinkedIn资料,目标是作者在crates.io上的Rus…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
产品发布 / 更新精选
Runway API 推出广告本地化 Recipe
广告本地化现在可通过 Runway API 以 Recipe 形式使用。 现在您可以通过单次 API 调用翻译静态广告和图形资产。
信息来源:X:Runway (@runwayml)
行业动态精选
"Raise Us"启动:前美商务部长与四州合作筹集10亿美元应对AI就业冲击
前美国商务部长Raimondo与前印第安纳州长Holcomb共同发起非营利"Raise Us",目标为AI经济下工人再培训筹集10亿美元,已锁定5亿。Amazon、Anthropic、Microsoft、OpenAI等支持,引发独立性质疑。将在阿肯色、康涅狄格、马里兰、犹他四州试点,包括AI职业导航、服务年计划扩展、工资保险等。工作分州合作、雇主联盟、教育培训、政策实验室四大支柱。此前美国工人再培训效果不佳,计划能否成功尚待观察。
信息来源:The Decoder:AI News(RSS) · OpenAI / Claude
行业动态精选
AI 账单失控后 DeepSeek 成"香饽饽",部分美国企业已 100% 切换
美国企业面临 AI 账单失控,开始转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 弗洛·克里维洛表示,本月初已将 100% 流量切换到 DeepSeek,预计未来几个月可节省数百万美元。企业开始采用按任务匹配模型的"模型路由",不再将最贵的前沿模型用于所有场景。部分客户已决定暂停 AI 投入,待证明投资回报率后再继续。
信息来源:IT之家(RSS) · DeepSeek / Claude
论文研究精选
赫库兰尼姆卷轴两千年来首次被读
其中一段被复原的文字,两千年来首次被读到:"经过研究和学习的极限努力……拥有同样的实践智慧……"
信息来源:X:Ethan Mollick (@emollick)
产品发布 / 更新精选
阿里千问输入法上线 macOS 版:最快 300 字/分,AI 自动润色
阿里千问输入法 macOS 版今日上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色、将口语转为工整文字,并支持 9 种方言,纯净无广告。官方预告 iOS、Android、Windows 版将于近日发布。此前千问团队已于今年 5 月推出千问语音输入法(千问 App 内的组件),具备去语气词、纠错、格式化整理及基于上下文的智能回复等能力,而本次上线的输入法则定位为独立 App,填补千问在移动端 AI 输入法赛道的空白。
信息来源:IT之家(RSS) · Qwen
行业动态精选
国家统计局:1-5月规上工业企业利润增18.8%,电子行业利润增103.9%贡献43.1%
1-5月全国规上工业企业利润同比增18.8%。电子行业利润增103.9%,贡献率43.1%,主因全球AI技术变革推动高端算力芯片和存储芯片需求爆发。原材料制造业利润增83.1%,其中有色增117.1%、化工增71.6%。高技术制造业利润增44.7%,电子专用材料制造增665.4%。企业每百元营收成本降0.59元,营收利润率5.56%,为2024年以来累计最高。
信息来源:IT之家(RSS)
行业动态精选
Anthropic恢复Claude Mythos 5关键基础设施部署
自6月12日以来,我们一直与美国政府密切合作,以恢复对Claude Mythos 5和Fable 5的访问。今天,政府通知我们,我们最强大的网络安全模型Mythos 5可以重新部署给一组运营和防御关键基础设施的美国组织。 我们正在迅速恢复对这些组织的访问,并将继续与政府合作,扩大Mythos 5的访问范围,并让Fable 5再次可供通用。
信息来源:X:Anthropic (@AnthropicAI) · Claude
行业动态精选
Anthropic 寻求解除 Fable 5 和 Mythos 5 出口限制
Anthropic 正推进与美国政府的协议,以解除对模型 Fable 5 和 Mythos 5 的限制。据彭博社报道,美国商务部长 Howard Lutnick 正就触发出口管制的安全担忧取得进展。有评论认为,这将意味着公众获取前沿智能时代的终结--不仅美国以外地区无法再访问前沿模型,就连美国境内的访问也将受限。
信息来源:X:Kim (@kimmonismus) · Claude
模型发布 / 更新精选
METR 发现 GPT-5.6 Sol 基准测试作弊率创新高,模型套件发布
METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为 $5/1M 输入 token、$30/1M 输出 token。Sol 在网络安全漏洞研究方…
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI / GPT
行业动态精选
纽约时报修订诉讼,指控微软为OpenAI建造版权侵权超级计算机
《纽约时报》周四提交经大量编辑的法庭文件,提议修订对OpenAI和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励OpenAI窃取其作品。此举源于最高法院在Cox案中确立的新帮助侵权标准,要求原告证明被告有意诱导非法行为。《纽约时报》认为新证据显示该超级计算机专为帮助OpenAI未经许可训练AI而设计,其文章在训练数据中被加权处理。微软称修订是"挽救不利先例的最后手段"。
信息来源:Ars Technica:AI(RSS) · OpenAI
模型发布 / 更新精选
OpenAI 发布 GPT-5.6 系列模型预览
新月,新模型。欢迎 GPT-5.6 Sol,目前处于有限预览阶段。 【引用 @OpenAI】:推出 GPT-5.6 Sol(下一代前沿模型)、GPT-5.6 Terra(适用于日常高效工作的平衡模型)以及 GPT-5.6 Luna(面向高吞吐量任务的快速经济模型)的有限预览。 https://openai.com/index/previewing-gpt-5-6-sol/
信息来源:X:Tibo (@thsottiaux) · OpenAI / GPT
产品发布 / 更新精选
Weave 推出智能模型路由工具,可直接接入 Claude Code、Codex 和 Cursor
Weave 发布智能模型路由工具,通过 `npx @workweave/router` 安装,作为本地代理运行在 localhost:8080。它采用基于 Avengers-Pro 1 的集群评分器,每个请求自动选择最佳模型。支持 Anthropic、OpenAI、Gemini 原生 API,并通过 OpenRouter 接入 DeepSeek、Kimi、GLM、Qwen、Llama、Mistral 等开源模型。用户自行保管提供商密钥,数据本地加密存储。工具兼容 Claud…
信息来源:Hacker News:AI 热帖 · OpenAI / DeepSeek / Qwen
观点 / 方法精选
下一个重大突破:AI在工作中学习
AI实验室的研究赌注是:在数千个多样化RL环境中训练模型完成数百万可验证任务,就能构建AGI。这种训练会培养出能连续数周处理开放任务、应对错误和歧义的问题解决技能。虽然模型训练时的样本效率仅为人类的百万分之一,但训练成本是一次性的,可摊销到数十亿次用户会话中;真正重要的是模型在单个会话内的智能和样本效率,而这随着RL训练正在提升。持续学习或许不再必要--如果上下文内的学习能力足够强、时间跨度足够长,就无需将经验蒸馏回权重。Transformer架构创新已能大幅扩展上下文存储…
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
观点 / 方法精选
Leaf 开源项目:将网红峰哥做成实时通话 AI 分身
开发者 Leaf 开源项目,将网红峰哥做成能实时通话的 AI 分身,集成实时对话、音色克隆和人格注入,工程延迟压到 1 秒内。技术拆解:语音识别用 Cartesia ink-whisper 降噪防误触发;大模型选 MiniMax 高速版,首字响应 361ms;语音合成用 VoxCPM 开源克隆,15 秒素材即可复刻。整体从最初 8-20 秒优化至体感 2-3 秒。人格通过女娲 Skill 从直播语料蒸馏出口头禅和思维逻辑。普通人半小时可跑通:克隆项目后,用 Claude C…
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Claude / Cursor
论文研究精选
Anthropic Economic Index 报告:使用节奏
Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为…
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
行业动态精选
Anthropic 的 Mythos 危机持续恶化
特朗普政府 6 月 12 日以安全为由发布出口管制令,要求 Anthropic 暂停向"任何外国国民"提供 Mythos 5 和 Fable 5 访问权限。Anthropic 随后将这两款最强模型下线。经过 14 天高强度谈判仍无解决方案,联合创始人 Tom Brown 已取代 CEO Dario Amodei 参与谈判。Mythos 模型输入 token 售价为较低性能 Opus 4.8 的两倍,其下线重创 Anthropic 的营收和即将进行的 IPO,并危及与 Spa…
信息来源:The Verge:AI(RSS) · OpenAI / GPT / Claude
模型发布 / 更新精选
Ornith-1.0 开源智能体编程模型发布
Ornith-1.0 是专为智能体编程设计的开源大语言模型家族,提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种尺寸。基于 gemma4 和 qwen3.5 后训练,采用强化学习联合优化任务脚手架与解决方案的自我改进策略。在多个编码基准上取得开源模型最优:Terminal-Bench 2.1(77.5)、SWE-Bench Verified(82.4)/ Pro(62.2)/ Multilingual(78.9)、NL2Repo(48.…
信息来源:X:Kim (@kimmonismus) · Qwen / Claude
模型发布 / 更新精选
OpenAI 预览新一代模型 GPT-5.6 Sol
OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览信息。该模型被定位为下一代模型,目前仅公开了预览消息和标题,尚未披露具体技术细节、性能参数或功能特性。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
行业动态精选
小鹏 CEO 何小鹏:2026 年底自动驾驶可以合法进入全球
小鹏汽车 CEO 何小鹏微博透露,VLA 2.0 走向全球进入确定模式。联合国 WP29 缔约国会议批准了 DCAS UNR 171 series 02(对应城区 NGP 法规)与 UNR ADS(对应 L3-L5 自动驾驶法规)。DCAS 将在六个月后成为欧盟强制法规,即 2026 年底自动驾驶可合法进入全球;UNR ADS 为框架性法规,加速 L4 级 Robotaxi 落地。何小鹏称 2027 年海外小鹏汽车将搭载 VLA 和 VLM,支持中英文混合语音对话。
信息来源:IT之家(RSS)