# 数据标注的思考

挫折与挑战，泪水与汗水

Canonical: https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation

Edition: cn · Language: zh-CN · Revision: 2026-09-21

Archived: 2025-07-14

Updated: 2026-09-21

存档日期为该文首次进入本仓库的日期；原始发布日期不详。

本次依据英文版核对并修订：模型负责初筛，专家负责复核、纠错与诊断标注；移除了模板占位图。

更新于   2026-09-21

## [挫折感](https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation#%E6%8C%AB%E6%8A%98%E6%84%9F)

医学影像标注中有许多挫折感，列举几个：

*   **管理(MANAGING)** 数据/数据集很难：正如我在[医学影像分析的挑战](https://astro-blog-bice-chi.vercel.app/blog/the-challenge-of-medical-image-analysis)中提到的，巨大的数据空间、多个来源、不同质量
*   **管理(MANAGING)** 标注也很难：你有一个标注员团队，他们有不同的专业水平/风格，你需要在多个轮次/版本中调整他们的能力**和**风格
*   **管理(MANAGING)** 任务也很难：你不能**一次性**标注所有内容，这太费事且不可能审查，但你最终需要将它们拼凑在一起。

但这些大多是勤奋问题，而不是技能问题。因此我将其描述为挫折感，而不是挑战。

## [挑战](https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation#%E6%8C%91%E6%88%98)

我认为，只有一个挑战： 专业知识的分配 或者一个更花哨的术语：任务-专业匹配 。

也就是说，你有些案例是乏味且费力的，需要耐心和灵巧；你有些案例需要大量专业知识，需要多年的培训。

这在自然图像CV任务中不太常见，大多数任务都可以用常识解决。

你可能在这里会扬起眉毛：如果我直接雇佣一个全专家的标注团队，所有问题都解决了。但作为一个个人轶事，我发现这不仅不经济，而且也不会产生最好的结果。正如我在[医学影像分析的挑战](https://astro-blog-bice-chi.vercel.app/blog/the-challenge-of-medical-image-analysis)中提到的，专家有不同的风格，很难对齐（对他人或你的规则）。

我相信挑战本身源于同时解决两个问题的目标，即：它看起来是什么样子，它实际上是什么？

通过与标注员密切合作多年，我很快意识到医学影像标注大致可以分为两种类型：

### [费力的工作](https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation#%E8%B4%B9%E5%8A%9B%E7%9A%84%E5%B7%A5%E4%BD%9C)

> 例如：发现异常

这类工作的关键在于需要耐心和灵巧，而不是专业知识。 经过适当培训的标注员可以在清晰规则和专家复核下承担此类勾画工作。

例子包括逐片滚动浏览 CT 扫描，寻找“团块状”的肺结节；任务需要清晰规则、适当培训和专家复核。

![肝脏血管标注](https://astro-blog-bice-chi.vercel.app/assets/blog/thoughts-on-data-annotation/liver-vessel.webp)

肝脏血管的**图示**。左：你想要标注的内容，右：你从模型预测开始的内容 [来自不同上下文论文的图](https://arxiv.org/pdf/2106.01860)

极端情况下，逐像素标注所有管状肺血管。

毫不奇怪，有时候**没有**临床专业知识的标注员会产出更好的质量标注，因为他们投入了纯粹的关注和精力。

### [专业工作](https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation#%E4%B8%93%E4%B8%9A%E5%B7%A5%E4%BD%9C)

> 例如：鉴别诊断

这是真正的临床专业知识发挥作用的地方，需要多年才能掌握。

识别一个非凡的异常就像与身体玩侦探游戏。它需要知道所有潜在的嫌疑人，他们可能的模式和反模式。你需要仔细检查细节以找到线索。通常，你必须超越异常区域，甚至查阅其他医学检查。这种专业知识当然不可能在一天或两天内发展。

简而言之，让专家做费力的工作是浪费的，让非专家处理专业工作是徒劳的。

## [（潜在的）解决方案](https://astro-blog-bice-chi.vercel.app/cn/blog/thoughts-on-data-annotation#%E6%BD%9C%E5%9C%A8%E7%9A%84%E8%A7%A3%E5%86%B3%E6%96%B9%E6%A1%88)

许多复杂问题的相同疗法：分而治之。

如果你的标注目标是为具有统一难度的数据集提供全面标签，除了让专家进行大量审查外，你没有什么可做的。

一个更好的解决方案是让专家进行快速分诊并缩小费力工作的数据空间，类似于[场景](https://astro-blog-bice-chi.vercel.app/blog/the-two-types-of-uncertainty#the-hypothetical-case)中描述的想法。

一个更可扩展的方案是构建职责不同的模型系统。初始检测或分割模型负责第一轮筛查，承担大量费力工作并标出需要人工复核的区域；它不必完美。专家集中处理关键、模糊的案例，纠正模型错误，并提供高层次的诊断标注。这种人在回路中的设置，让标注流程更灵活，也让专家的时间更有价值。

我想提出的最后一点是关于标注应该是什么。

在传统CV中，所有标签都基本上”转码”为索引，失去了原始上下文，因此需要大量数据来训练模型。相比之下，人类用更少的数据但用更丰富的标注（信号）学习。

这表明，如果我们用更多语义标注”教授”模型，它可能会用更少的数据产生更好的结果。
