AI圈报
观点 / 方法精选

DharmaOCR 利用 DPO 将文本退化率降低 59.4%

信息来源:Hugging Face:Blog(RSS)·
原始标题:Direct Preference Optimization Beyond Chatbots

内容摘要

4月发布的DharmaOCR(结构化OCR模型)在巴西葡萄牙语文档提取任务中,使用直接偏好优化(DPO)作为监督微调(SFT)后的第二训练阶段。SFT无法直接惩罚文本退化(重复循环),而DPO以模型自身失败输出(退化循环)作为负样本进行偏好训练,使所有测试模型族的文本退化率平均降低59.4%,最高达87.6%(如Nanonets-OCR2-3B从1.61%降至0.20%)。传统DPO多用于聊天对齐,该工作将其扩展至客观的OCR任务,证明DPO可针对性修复特定失败模式。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hugging Face:Blog(RSS)
站内情报编号intel-43a841e95cf275f5e39784f4