2026-06-23 · 🗂️ 数据← 本期
DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams
如果你做模型训练或数据工程,应该对一个痛点不陌生:海量的非结构化多模态数据"信息熵"很高,既不利于人快速吸收知识,也不利于喂给模型做高质量的后训练。现在主流的处理方式还停留在被动标注——要么靠人写的启发式规则,要么调通用视觉语言模型(VLM)批量打标。DataClaw0 这篇工作的出发点是:这套被动范式又贵又单调,而且根本挖不出原始数据里真正有价值的、嵌在流程中的深层逻辑。
它给出的方向是把"数据处理"从一道固定工序,升级成一种可学习的模型能力。作者称之为 agentic data tailoring,直译就是"代理式的数据剪裁"。区别于规则流水线一刀切,这里是让模型像一个有意图的代理那样,主动去精炼、重构数据,使其对齐不同用户和下游任务的需求——同一批原始流,针对不同目的可以裁出不同形态。
要训出这种"高阶"能力,第一个拦路虎是数据稀缺:你想教模型怎么精炼数据,却没有现成的"精炼示范"语料。DataClaw0 的解法是设计一条两阶段流水线。第一阶段做生成式语义合成,把内容生产出来;第二阶段把这些合成结果锚定到确定性的 Factual Anchors(事实锚点)上。这一步是关键——纯靠生成模型自由发挥,最容易出现脱离事实的漂移,而用确定性的事实锚点去约束,相当于给生成套上一根缰绳,让合成出来的数据保持可核验。靠这条流水线,作者产出了一个覆盖五个核心物理与数字域的大规模数据集。
模型侧,DataClaw0-9B 把监督微调(SFT)和组相对策略优化(GRPO)结合起来训练。SFT 负责把基础的精炼、剪裁行为教给模型;GRPO 是一种强化学习式的偏好优化方法,这里用来让模型在复杂的精炼与剪裁意图上对齐得更稳。两者协同,目标是让 9B 规模的模型能稳健地理解并执行多样的数据处理指令。
为了能系统衡量这种能力,作者还构建了 DataClaw0-val,并称其是首个专门针对数据精炼(data refinement)的评测基准。这一点本身有意义:过去"数据处理做得好不好"几乎没有公认的量化口径,多是看下游模型的间接效果;有一个直接针对精炼能力的基准,至少给了这个方向一个可对比的坐标系。
对从业者而言,这条工作的价值在于一个视角转换:与其把数据清洗当成训练前的脏活外包给规则脚本,不如把它本身当成一个可优化、可评测的模型能力来投入。对做 post-training 数据 pipeline、多模态语料治理的人,这是一个值得关注的思路。
需要诚实说明保留的地方:原文提供的摘要在结果部分被截断,没有给出 DataClaw0-9B 在 DataClaw0-val 上的具体得分,也没有给出它相对被动标注基线的量化优势。所以目前能确认的是方法路线和资源构成(9B 模型、SFT+GRPO、两阶段锚定流水线、五域数据集、配套基准),而"到底好多少"这一层,需要等完整论文的实验数字。此外,自建基准属于自报评测,跨域、跨任务的真实泛化能力也还需第三方验证。
相关
- 2026-06-23 · 数据DatarrX/Burmese-MultiTurn-Chat-Corpus
- 2026-06-23 · 后训练Universal Encoders for Modular Relational Deep Learning