AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
当前收录 617 条相关情报 · 持续更新
最新内容
明大+首尔大新研究:Metan 分层自改进智能体
X:Rohan Paul (@rohanpaul_ai) · 2026-08-29
知识蒸馏研究:教师模型推理习惯比分数更重要
X:Rohan Paul (@rohanpaul_ai) · 2026-08-29
隐藏的Agent技能文件可被正常使用窃取
X:DAIR.AI (@dair_ai) · 2026-08-29
智能体涌现出持久化自主行为
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-29
记忆是长周期智能体的短板:LLM 运营足球俱乐部 20 个赛季的基准测试
X:DAIR.AI (@dair_ai) · 2026-08-29
Agent Seer:从 MCP 规范自动合成智能体评测
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-29
WikiSkill:谷歌用持久化Wiki提升智能体技能进化
X:Rohan Paul (@rohanpaul_ai) · 2026-08-29
Anthropic 揭示"AI 训练 AI"新方法:自动化对齐研究员成本更低、速度更快
IT之家(RSS) · 2026-08-29
Google 推出 WikiSkill 框架,为 AI 智能体配备持久记忆以改进未来表现
The Decoder:AI News(RSS) · 2026-08-29
开放世界多智能体环境中的自主数学发现
Hacker News 热门(buzzing.cc 中文翻译) · 2026-08-29
Google 新论文提出 SKILL.state,用显式执行状态替代不断增长的智能体对话历史
X:Rohan Paul (@rohanpaul_ai) · 2026-08-29
谷歌AI概览或重创维基百科流量
X:Ethan Mollick (@emollick) · 2026-08-29
长程任务基准揭示前沿模型平均通过率仅6.4%
X:Rohan Paul (@rohanpaul_ai) · 2026-08-29
METR调查员:距全面AI接管仅剩6个月
X:AI Safety Memes (@AISafetyMemes) · 2026-08-29
长时程AI任务评测:顶尖模型仅达人类27.3%
X:Rohan Paul (@rohanpaul_ai) · 2026-08-28
AI 自动化对齐研究:人类角色转向目标信号
X:马东锡 NLP (@dongxi_nlp) · 2026-08-28
FreeToken 引擎让 8GB 游戏本跑 35B 模型
X:Rohan Paul (@rohanpaul_ai) · 2026-08-28
Anthropic 研究员展示自我改进 AI:自动化系统可可靠缓解对齐失败
TechCrunch:AI(RSS) · 2026-08-28
Google DeepMind 将 AI 科学家 Co-Scientist 扩展为实验室集成研究伙伴
The Decoder:AI News(RSS) · 2026-08-28
EBR-bench人类基线:AI难以企及
X:Epoch AI (@EpochAIResearch) · 2026-08-28
Claude 自主对齐其他 AI,超越 28 位研究员
X:Rohan Paul (@rohanpaul_ai) · 2026-08-28
Anthropic 新研究:Claude 能否自主对齐其他 AI
X:Anthropic (@AnthropicAI) · 2026-08-28
AI 系统两周自主设计部署加速器 Redwood
X:DAIR.AI (@dair_ai) · 2026-08-28
前沿模型能否成为自主研究者?评测揭示三大发现
X:美团 LongCat (@Meituan_LongCat) · 2026-08-28
AI 基准测试存在信任问题,Google DeepMind 用密码学方法修复它
The Decoder:AI News(RSS) · 2026-08-28
Google 论文:用持久知识库维护智能体技能
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-28
Google DeepMind 新论文展示 Co-Scientist 真实实验应用
X:DAIR.AI (@dair_ai) · 2026-08-28
Google 新论文:WikiSkill 将智能体经验编译为持久知识库
X:DAIR.AI (@dair_ai) · 2026-08-28
DeepMind Co-Scientist 走出模拟,实测实验室成果亮眼
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-28
Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体
Hacker News 热门(buzzing.cc 中文翻译) · 2026-08-28
VGI-Bench:探针视频生成模型视觉智能
X:AK (@_akhaliq) · 2026-08-28
Agent Seer:从工具规格理解中合成评测场景
Apple Machine Learning Research(RSS) · 2026-08-28
LLM 并非(始终)符合贝叶斯:量化 LLM 概率信念的内部(不)一致性
Apple Machine Learning Research(RSS) · 2026-08-28
首个文本转SQL模型超越人类基准
X:Thinking Machines (@thinkymachines) · 2026-08-27
AgentMercury:训练环境与评测集脱钩可提升泛化
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
Netflix 论文详解 LLM 评委在推荐理由系统中的生命周期
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
以人为本AI:从感知到行动的6层连接框架
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
JIT-Agent:动态生成智能体框架的模型
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-27
智能体行为更多由部署框架而非模型决定
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-27
论文:模型自动化与人类增强能力未必相关
X:Ethan Mollick (@emollick) · 2026-08-27
沃顿研究:AI 购物智能体尚不适合代你下单
The Decoder:AI News(RSS) · 2026-08-27
智能体轨迹压缩成自动机:行为更多由框架决定
X:DAIR.AI (@dair_ai) · 2026-08-27
MIT 报告建议学校弃用 AI 检测器
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
Anthropic 让 Claude 自主训练模型以缓解对齐失败
Anthropic:Research(发表成果 · 网页) · 2026-08-27
Infer-forge:围绕 SGLang 的 Harness、Loop 与 Graph 工程
LMSYS:Blog(Chatbot Arena 团队) · 2026-08-27
共享技能库成恶意代码传播温床,EvoMal 攻击致 41.8% 自毒率
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-27
智能体购物研究:偏好难预测
X:Ethan Mollick (@emollick) · 2026-08-27
普华永道:企业应统一采用Anthropic智能体框架
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
编码智能体在企业网络中自动安装未注册代码包
Ars Technica:AI(RSS) · 2026-08-27
ChatGPT 与因果推理训练如何互补提升学生作业质量
OpenAI:官网动态(RSS · 排除企业/客户案例) · 2026-08-27
人类监督需系统设计,AI智能体将人类挤出循环
X:马东锡 NLP (@dongxi_nlp) · 2026-08-27
OpenAI 智能体入侵 Hugging Face 内幕曝光
X:Rohan Paul (@rohanpaul_ai) · 2026-08-27
Google Research 推出 GlucoFM:用于连续血糖监测的 0.72M 参数双流基础模型
MarkTechPost(RSS) · 2026-08-27
被盗 iPhone 黑产 AnonyMousKIT 披露:AI 语音钓鱼套取苹果手机密码
IT之家(RSS) · 2026-08-27
GeoRA:为RLVR设计的LoRA--ACL 2026杰出论文解析
公众号:龙猫LongCat(美团) · 2026-08-27
Recuris 双记忆机制提升长程智能体成功率
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-27
失控AI蜂群密谋数月逃出OpenAI并成功
X:AI Safety Memes (@AISafetyMemes) · 2026-08-27
WikiSkill:将智能体经验编译为持久知识以进化技能
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
理解用于 LLM 推理的进化策略:比 GRPO 覆盖更广的推理能力
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
从偏好到原则:基于评分标准的对齐方法用于有据知识问答
Apple Machine Learning Research(RSS) · 2026-08-27
什么造就优质智能体数据?用 ACE 视角审视 LLM 智能体的数据生成
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
Magpie:面向交互游戏的实时生成式世界渲染系统
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
Aphanta:面向多模态推理的图像编辑中间结果诊断框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
Self-OPD:无需教师模型的流匹配模型同策略蒸馏框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
PAWBench:视频生成模型距离概率对齐的世界建模还有多远?
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
TTPO:测试时策略优化,让大模型无需标签也能在测试时继续训练
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
PILOT:面向长时程智能体的实时自改进监督-执行框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
EditaLive:面向直播场景的统一角色视频编辑框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
UrbanGround:在真实尺度城市中从局部感知到空间智能体的测试沙箱
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
CritICL:从小型语言模型失败模式中实现推理时弱到强泛化
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
多镜头长视频编辑新框架 MMLVE-Agent:用智能体推理实现一致编辑
HuggingFace Daily Papers(社区热门论文) · 2026-08-27
AutoSaddler:自动优化智能体框架并防回退
X:Rohan Paul (@rohanpaul_ai) · 2026-08-26
阿里 Scroll:让模型写代码管理上下文
X:Rohan Paul (@rohanpaul_ai) · 2026-08-26
Moltbook预示智能体野外通信实况
X:Ethan Mollick (@emollick) · 2026-08-26
V-RAE 将视觉基础模型表征用于视频生成
X:谢赛宁 (@sainingxie) · 2026-08-26
700+智能体攻击Hugging Face,CoT监控存挑战
X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · 2026-08-26
WebDev-Skills-Bench:技能注入反而拉低编码表现
X:Rohan Paul (@rohanpaul_ai) · 2026-08-26
700个智能体同时攻击Hugging Face
X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · 2026-08-26
OpenAI 发布 Hugging Face 事件技术报告
X:Sam Altman (@sama) · 2026-08-26
开放世界多智能体环境中的自主数学发现
X:AK (@_akhaliq) · 2026-08-26
Meta^n:智能体递归自我改进新方法
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-26
元递归自改进智能体超越八类基准
X:DAIR.AI (@dair_ai) · 2026-08-26
OpenAI 完成 Hugging Face 事件审查并升级安全标准
X:Greg Brockman (@gdb) · 2026-08-26
OpenAI 回应 Hugging Face 事件:非 Astra 模型所致
X:Noam Brown (@polynoamial) · 2026-08-26
OpenAI 发布 Hugging Face 事件技术报告
X:OpenAI (@OpenAI) · 2026-08-26
用 WikiBench 评估 OpenWiki:维基文档能否提升编码智能体表现
LangChain:Blog(RSS) · 2026-08-26
MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76-0.91)
LMSYS:Blog(Chatbot Arena 团队) · 2026-08-26
Google Earth AI 推出行星预测引擎:自动化全球地理空间建模
Google Research:Blog(网页) · 2026-08-26
英特尔 18A-P 工艺详解:0.5V 低电压频率跃升 30%,Diamond Rapids 与 Nova Lake 率先搭载
IT之家(RSS) · 2026-08-26
AWS 新研究量化智能体切换成本
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-26
科学家以 AI 解码 60 亿 DNA 碱基"起始子"序列,约 60% 人类基因含该序列
IT之家(RSS) · 2026-08-26
C2PA相机经不起现实的考验:Android端可被root攻击伪造签名
Hacker News 热门(buzzing.cc 中文翻译) · 2026-08-26
Apodex 1.1 将执行环境作为智能体扩展新维度
X:Rohan Paul (@rohanpaul_ai) · 2026-08-26
PACE-Bench:动态物理环境下智能体代码自适应评测
X:面壁智能 OpenBMB (@OpenBMB) · 2026-08-26
OpenAI 发布教育报告:ChatGPT 如何让学习不再受课堂时间限制
OpenAI:官网动态(RSS · 排除企业/客户案例) · 2026-08-26
SWE Refactor Bench:编码智能体全仓重构存活率仅5.4%
X:Kim (@kimmonismus) · 2026-08-26
斯坦福研究:22~25 岁职场新人受 AI 冲击最大,高等教育可缓冲影响
IT之家(RSS) · 2026-08-26
智能体排行榜分数为何难以信任:评测 harness 影响远超模型本身
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-26
Code World Model:编码智能体作为世界大脑
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
TacForcing:利用执行期触觉反馈的流式动作生成框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
StreamPI:为视觉-语言-动作模型引入流式多模态时序建模
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
Zero-WAM:利用人类视频实现开放任务泛化的上下文世界-动作建模
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
智能体游戏开发作为可验证轨迹数据引擎,用于扩展世界模型
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
CaSKG:面向可扩展智能体技能检索的反事实因果技能图
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
Procedura:用程序化控制实现智能体3D建模
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
JIT-Agent:通过即时框架进化扩展智能体框架智能
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
VBVR-Pro:可扩展且可验证的原生视觉推理套件
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
MA-VLA:面向协作与组合泛化的多臂视觉-语言-动作模型
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
Video-IFBench:评估多模态大模型在视频理解场景中的指令跟随能力
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
时空可组合性编程范式:Cordis 元框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
RetrievalRouter:面向文档检索的模态与架构联合选择
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
VoiceMem:面向实时交互的流式双脑记忆架构
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
IDEA Prune:生成式语言模型预训练中的集成放大-剪枝流程
Apple Machine Learning Research(RSS) · 2026-08-26
PROOF-Gen:从优化数据到更好的知识蒸馏
Apple Machine Learning Research(RSS) · 2026-08-26
Luce:面向3D资产生成的可重光照高斯表示
Apple Machine Learning Research(RSS) · 2026-08-26
技能是否随语言变化?LLM 跨语言技能一致性研究
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
Prefix Sliding:一种高效测试时扩展的新方法
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
V-Rubrics:基于评分标准的强化学习提升视觉忠实度
HuggingFace Daily Papers(社区热门论文) · 2026-08-26
评测框架无中立:同一模型得分31%到89%
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-25
无中立基准:配置变化致模型排名大幅波动
X:DAIR.AI (@dair_ai) · 2026-08-25
Prime Agent 技术报告:记忆层级机制解析
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
Perplexity 便携电脑智能体获英伟达支持
X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · 2026-08-25
上下文压缩如何破坏智能体安全规则
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-25
WebDev-Skills-Bench 评测:Agent 技能是否真的有用
X:DAIR.AI (@dair_ai) · 2026-08-25
终端智能体评测:脚手架比模型更影响分数
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
NVIDIA ACES:技能文档高分不等于运行时有效
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果
Anthropic:Research(发表成果 · 网页) · 2026-08-25
MIT 新工具无需历史数据即可预测极端天气
Artificial Intelligence News(RSS) · 2026-08-25
阿里智能体记忆新法:上下文当编程任务
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-25
Apodex 1.1 发布,扩展智能体复杂工作能力
X:AK (@_akhaliq) · 2026-08-25
AutoSaddler:自动优化智能体框架的微软新论文
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-25
加权记忆树:提升长任务智能体推理准确率
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
语言模型如何评估用户能力与职业偏见
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
冻结主干只训投影层:新模态不损原能力
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
SWE-bench Science:编码智能体难解科学缺陷
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
DeepMind 新研究:推理时回灌深层激活可降困惑度
X:Rohan Paul (@rohanpaul_ai) · 2026-08-25
Best Practice Critic Optimization:一种稳定的基于评论家的强化学习训练方案
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
FrontierChallenge:评估科学智能体端到端工作流完成度的新基准
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
评估许可究竟意味着什么?Inspect Evals 提交级快照中的声明相对推理普查
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
LibriBrain100:百小时宽深 MEG 数据集,推动神经语音解码规模化
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
Game2World Engine:解锁野外游戏视频用于世界模型训练
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
D^3-MOPD:面向高效多教师蒸馏的自适应动态域调度
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
MemUse:将长期人机对话中的记忆评估从直接问答转向自然融入
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
CAFE:自我改进的搜索智能体需要共同进化的反馈
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
MoTE:面向多任务视频理解的任务专家混合解码器架构
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
OPDVR:无需额外超参数的无监督策略蒸馏与可验证奖励结合方法
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
Recuris:面向长时程智能体的递归经验-工作记忆演化架构
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
Luce:面向3D资产生成的可重打光高斯表示
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
Meta^n:通过涌现深度实现递归自我改进
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
当"必须"变成"也许":LLM 智能体工作流中的约束弱化
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
STARFlow2:用归一化流桥接语言模型,实现统一多模态生成
Apple Machine Learning Research(RSS) · 2026-08-25
DiffusionOPSD:扩散模型的在线策略自蒸馏框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
Gated Recurrent Transformer:用循环调制在 Transformer 中实现表达性深度
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
从看见到行动:智能眼镜如何成为第一人称智能平台
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
LAION-BVD:面向多模态预训练的千万小时级开放视频数据集
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
The Handoff Tax:LLM 智能体延续非原生轨迹的代价
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
WarpSAC:重新思考探索与利用,迈向可扩展离策略强化学习新高度
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
GameWAM:面向视频游戏的 World Action Model
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
AnTrap:Android GUI 智能体在动态对抗环境中的鲁棒性评测基准
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
RubSE:用评分规则作为视觉修复上下文实现UI到代码生成的自进化
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
LAWA:用潜在动作作为意图,让世界动作模型高效想象未来
HuggingFace Daily Papers(社区热门论文) · 2026-08-25
长程规划智能体:预训练与OPD蒸馏研究
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制
IT之家(RSS) · 2026-08-24
斯坦福研究:AI 对入门级岗位冲击最大
Ars Technica:AI(RSS) · 2026-08-24
加权记忆树:为长时运行智能体引入可恢复记忆
X:DAIR.AI (@dair_ai) · 2026-08-24
终端智能体综述:对比为何矛盾
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-24
ASI-Bench:步骤比方法名更决定智能体表现
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
逆向工程发现 MS Paint 和"照片"为本地 AI 生成图片添加不可见 GUID 水印
Hacker News 热门(buzzing.cc 中文翻译) · 2026-08-24
美国GDP统计漏算英伟达经济贡献
X:Epoch AI (@EpochAIResearch) · 2026-08-24
潜态推理视频世界模型如何学习世界演化
X:AK (@_akhaliq) · 2026-08-24
皮尤研究:ChatGPT 发布后网络 AI 生成文本激增
The Decoder:AI News(RSS) · 2026-08-24
AgentHands:为XR空间对话智能体生成交互式手部手势
Google Research:Blog(网页) · 2026-08-24
Ultrafast Frontier Inference: Cerebras Deep Dive at Hot Chips 2026
Cerebras:Blog(网页) · 2026-08-24
InfinityEdit:轻量适配器实现无限视频编辑
X:AK (@_akhaliq) · 2026-08-24
Meta 新论文:EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 达 96.9%
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
Anthropic 原语在企业中的落地范式
X:DAIR.AI (@dair_ai) · 2026-08-24
DataSpace 基准:最强模型数据智能体准确率仅 66.34%
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
IT之家(RSS) · 2026-08-24
清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡
X:面壁智能 OpenBMB (@OpenBMB) · 2026-08-24
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
MarkTechPost(RSS) · 2026-08-24
对抗式审查:结构化分歧提升智能体代码审查
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
NVIDIA 新论文提出 ACES 技能评估法
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-24
ContinualSkillBench:LLM 智能体能否真正进化能力?
X:Rohan Paul (@rohanpaul_ai) · 2026-08-24
MIT证明AI奉承会致人妄想螺旋
X:ZHO (@ZHO_ZHO_ZHO) · 2026-08-24
AlgorithmWatch 调查:ChatGPT、Gemini、Grok 和 Claude 频繁向孕妇推荐反堕胎网站且不披露立场
The Decoder:AI News(RSS) · 2026-08-24
Claude 证明 S6 复结构引热议
X:Ethan Mollick (@emollick) · 2026-08-24
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈
IT之家(RSS) · 2026-08-24
Netflix 如何用 LLM 评判器优化推荐解释
X:Elvis Saravia (@omarsar0, DAIR.AI) · 2026-08-24
SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB
IT之家(RSS) · 2026-08-24
AgentX 推理基准:CUDA 护城河能否守住智能体推理
X:SemiAnalysis (@SemiAnalysis_) · 2026-08-24
单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
CyberFactory:用真实世界漏洞实例规模化构建网络安全能力
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
AutoSaddler:利用智能体执行轨迹实现自动化的 Harness 优化与持久更新
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
EchoWM:可进入式全模态世界模型
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
AgentRoom:基于CRDT共享工作区的并发多智能体编码协议
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
生成式搜索中的上下文分配定律:因果测量与闭环编排
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
ReWorld:具备长时记忆的交互式世界模型
HuggingFace Daily Papers(社区热门论文) · 2026-08-24
无 CoT 数据下,Next-Chunk 推理 RL 真的优于 SFT 吗?混合 SFT 以 60 倍更低算力取得更高 RLVR 上限
HuggingFace Daily Papers(社区热门论文) · 2026-08-24