← DSAI5T09 全部讲次
L03

L03 Ethical Data Handling:手上有数据,不等于拿到了使用许可

integrity 的两个维度,加一套从取数到退役的职业动作清单。

一句话版

integrity 是没人看着时的那个选择,落到数据上就是一串可查的动作。

一个类比:替邻居保管一把备用钥匙

邻居出差,把备用钥匙交给你,说麻烦帮忙浇下花。从这一刻起几件事同时成立:你能进那扇门,但只被允许为浇花而进;屋里没有摄像头,你怎么做没人知道;钥匙不属于你,事办完要还。

这一讲讲的全部动作都在这个场景里。进门前先说清楚这趟是去浇花,对应 p.14 那句数据本身不构成行动许可,要先定用途、权限、来源和适用性。只拿浇花那一把、不拿一整串,对应最小化。浇完花顺手帮忙收个快递,看着无害,可那是一个新的决定,得再问一次,对应 p.15 那条二次使用、数据关联、对外共享都属于新的伦理决定。每次进出留张便条写清动过什么、哪些没检查,对应 p.17 的数据护照。邻居搬走之后钥匙要还,对应 p.21 里模型的退役。

类比在哪里失效:钥匙只关一户人家,一个模型的阈值同时决定成千上万人的机会;邻居知道你有钥匙,被记录进数据集的人常常不知道自己在里面,也无从拒绝。钥匙还了这件事就结束了,而 p.35 的说法是模型部署之后不存在中立状态,它每天都在分配注意力、机会、风险与资源。最后一层差别是 p.26 的 recourse:邻居发现花被浇死了能直接找你,被算法判错的人往往连找谁申诉都不知道。

概念卡

1. integrity 的两个维度

人话定义:p.4 把 integrity 拆成互不可分的两半,一半朝外,一半朝内。

integrity 的两个维度与回报顺序这一分析线索:左卡 01 Moral character in action 朝外,关键词 HONESTY、PRINCIPLE、CONDUCT;右卡 02 Wholeness within 朝内,关键词 UNITY、COHERENCE、SELF;下方时间轴标出酬谢落在选择之后

例子:美国俄克拉何马州 Norman 的 Goodwill 员工 Andrea Lessing 交还了毛衣口袋里的 $42,000,酬谢发生在选择之后,可作为分析动机的线索,但不是充分判据(p.8)。

常见误解

把「内在完整」理解成从不动摇 → 课件明确说过它并不意味着从不产生疑问,指的是价值观之间不打架、私下与公开的自己对得上。只答「诚实」也只答了 01 那一半(p.4、p.5)。

2. 数据不等于许可

人话定义:拿到一份数据只说明技术上可以算,不说明伦理上可以用。p.14 要求动手前先定四件事:purpose(为什么要用)、permissions(谁允许了什么)、provenance(从哪来、怎么来的)、fitness for use(它撑不撑得起这个问题)。

例子:p.15 的三个动作是 MINIMISE(只取必要字段)、CHECK CONSENT(核对当初同意的范围)、PAUSE AT NEW USE。最后一条最容易漏——二次使用、把两份数据关联、对外共享,这三件事都是新的伦理决定,不能默认原许可已经覆盖。

常见误解

以为合规审批通过就等于伦理上过关 → 审批回答的是法律问题,而目的是否正当、适用性够不够,仍然要单独回答一次(p.14)。

3. 数据护照

人话定义:p.17 要求每份数据带四项记录同行。

数据护照的四项记录:01 Origin 来源、02 Boundary 边界、03 Transformation 变换、04 Limitations 局限,青绿框住第四行,合格的写法是让别人看懂这份数据不能支撑什么结论

例子:第二节整节挂在 ASA《Ethical Guidelines for Statistical Practice》(2022) 上,八条原则 A 到 H 共 72 个 element,本讲主要引 B(数据与方法)、C(利益相关方)、D(数据主体)、E(团队)、F(同行与职业)(p.12)。

常见误解

把局限一栏写成免责声明 → p.18 的要求是 SHOW 与 DO NOT HIDE:展示不确定性与敏感性,同时不隐瞒做过哪些选择。把事后才定下的分析选择说成事前就计划好的,属于典型违规;结论要做到诚实且有意义,而非仅仅有说服力。

4. 压力三信号与升级路径

人话定义:p.20 中间那一列是一个大大的 ≠,三句都是压力,没有一句构成新的专业标准:

PRESSURE SIGNALPROFESSIONAL RESPONSE
Just make the result clearer.不要误导:讲清不确定性、局限,以及证据究竟能支撑什么
We need to move faster.不要牺牲有效性:速度不构成不当统计实践的理由
Everyone on the team agrees.把问题提出来:走 ethical escalation path

例子:第三条引的条款是 E.1 到 E.4,对跨学科团队成员的责任——在团队里把问题提出来是明文写下的职业义务(p.20)。

常见误解

把「共识」当证据 → 大家都同意只说明压力来自层级或群体,与结论是否成立无关。这一条和第一讲那个冒牌货 Social Beliefs 是同一个东西换了场景(p.20)。

5. 三次 PAUSE 与部署之后

人话定义:p.22 的三次 PAUSE 是全讲最通用的清单,第三次往下再展开成 p.21 的部署三段。

三次 PAUSE 与部署之后的三段义务:上排三张卡片是碰数据之前、发结果之前、决策做出之后三次暂停,第三次向下展开成 BEFORE 验证、DURING 监控漂移、AFTER 纠正或退役,青绿标出退役这一项

例子:p.29 给的数字是群体间假阳性差异达 10 到 100 倍,出自一项对 189 个人脸识别算法的研究。结论一句话:平均准确率不够,评估必须按群体拆开看。

常见误解

以为公平性指标算出来就等于公平 → p.31 的说法是这类指标用来 inform 而不能 replace 伦理判断。同类误解还有把代理指标当目标本身,p.30 讲的正是可测量的替身怎么一步步篡位(p.30、p.31)。

把它们串起来

三节是一条收窄的漏斗:先定义 integrity(p.3 到 p.10),再把它翻译成职业标准(p.12 到 p.23),最后回答为什么在数据科学里这件事格外要紧(p.24 到 p.35)。

第一节的判据是外部激励缺席——没人看、没掌声,选择仍然一样。第二节把这个判据拆成可执行清单,终点是 p.23 那六个形容词:PURPOSEFUL、MINIMAL、PROTECTED、TRANSPARENT、VERIFIABLE、ACCOUNTABLE,每一个都对应前面某一页的动作。第三节给出理由链 DATA → MODEL → DECISION → CONSEQUENCE:数据的选择会沿着这条链一路走到某个具体的人身上,所以伦理没法当成事后附加件(p.25)。三个最常被忽略的决定点在 p.28——收集什么、怎么打标签、拿什么测试,课件的要求是这三处都要被记录、命名、检查。最后收在 p.34 的三个 P:PEOPLE、POWER、PROOF。

课件里的坑

  • [标题差异] 封面标题印的是 Foundations & Ethical Data Handling,与课程大纲和课表上的 Data Science with Integrity: Ethical Data Handling and Responsible Code 对不上,按大纲那个为准
  • [补充出处] p.29 可对照 NIST 2019 研究:共测 189 个算法;10–100 倍指一对一匹配中部分群体的假阳性率差异,取决于具体算法,不能说全部算法都有同样差异
  • [课件留白] p.11 列出的四个职业视角里,后面的视角条目在这份课件里并没有展开,别按目录去找对应内容
  • [排版提醒] p.17、p.21、p.23 等多页有 Origi/n、BEFOR/E、PURPOSEFU/L 这类断词,属 PDF 转换时的文本框折行,不是课件内容错误

课后 10 分钟:考点复习

这 10 分钟怎么用:合上页面,先默写三条——integrity 的两个维度、数据护照四项、三次 PAUSE 各在什么时刻;再把下面的「变式题」做一遍;最后回查两个最容易错的地方——以为合规审批通过就等于伦理上过关、把「共识」当证据。三步做完再往下看答案。

两份评估都是场景式伦理分析,没有期末考试。下面两句是我的押题,课件没有给题型说明:Online Quiz 的细节题大概率落在第二节,它整节挂在 ASA 2022 那份文本上,条款号和「Professional rule」那一行是现成的选择题素材;Written Assignment 更可能给一个场景让你排出动作顺序。不管出哪种题,真正要背熟的都是三次 PAUSE、四步工作流和三个 P 这三套清单,以及各自能追问哪些证据与风险。

必背

  1. integrity 两个维度不可分割:对外是 Moral character in action(HONESTY、PRINCIPLE、CONDUCT),对内是 Wholeness within(UNITY、COHERENCE、SELF),只答「诚实」会漏掉另一维度
  2. 事后酬谢有助于分析行为动机,但回报先后不是 integrity 的充分必要判据——案例金额为 $42,000 与 $1,000
  3. 手上有数据不等于获得使用许可;动手前先定 purpose、permissions、provenance、fitness for use
  4. 再利用、关联、共享都是新的伦理决定,要重走一遍目的检查,应核对原许可是否覆盖新用途,不能默认沿用
  5. 数据护照四项 Origin、Boundary、Transformation、Limitations,记到别人能看懂它不能支撑什么结论
  6. 三种压力信号都不等于标准:讲清楚一点、快一点、大家都同意;回应是走 ethical escalation path,条款落在 E.1–E.4
  7. 模型上线不等于做完:BEFORE 验证、DURING 盯漂移、AFTER 纠正或退役,退役同样是职业义务
  8. 平均准确率不够——189 个人脸识别算法的测试里群体间假阳性差异达 10–100 倍,评估必须按群体拆开看

完整例题

这门课没有计算题,这一格换成案例判断。下面是依据课件清单设计的练习,不是课件原题:自编情境:某医院拟用历史就诊频次代理病情严重度,分数高者优先安排医生,仅报告整体准确率、未做分组评估。请用三套清单各分析一遍,分别指出已知问题、待核实事实和建议措施,不要求给清单排先后。

① 三次 PAUSE(p.22)。第一次在碰数据之前:历史就诊记录当初是为诊疗和结算采集的,拿来训练分诊模型属于二次使用,要重新核对许可与目的。第二次在把结果交出去之前:严重度分数会直接改变排队顺序,必须说明它在不同人群上的表现差异。第三次在决定已经产生之后:那些被排到后面的人有没有申诉渠道。三次的共同问题是同一句——我们能不能向受影响的人解释它、保护它、为它的使用辩护。

② 四步工作流(p.32)。JUSTIFY:就诊频次是否足以代理严重度?可及性差的人可能因看不起病而记录稀疏,这是需验证的风险,不能当作题面已证实的结果。DOCUMENT:记录来源和局限。TEST:做有依据的分组评估。QUESTION:持续质疑代理指标与部署后果。

③ 三个 P(p.34)。PEOPLE:受影响的是急诊排队的病人,其中一部分没有能力表达诉求。POWER:分数在医患之间转移了决定权,且不对称。PROOF:现有证据只有整体准确率,没有分组结果。

④ 结论与切入点:不应按现状上线,至少要补齐分组评估、把分数改成给医生参考而不直接排序、加上申诉与人工复核通道。本示范从四步工作流的 JUSTIFY切入代理指标问题;三套清单没有唯一先后排名。第一次 PAUSE 就能质疑采集目的、许可与代理指标的合理性;三个 P 也能在上线前追问权力与证据的缺口。切入点取决于提问深度,不是固定的发现顺序。

变式题(先自己做)

某公司用员工工牌门禁刷卡记录(当初为安保采集)训练”离职风险预测”,HR 拿分数决定谁不进晋升名单。员工不知道有这个分数。

用三套清单各过一遍:哪些问题已由题面证实,哪些信息还需追问?提出可操作的改进,并说明你选择的切入点。

提示

三套清单都可在上线前使用,没有固定的发现顺序。先区分“员工不知情”这个已知事实,与“许可范围、评估方法、申诉机制”这些待核实信息。

参考答案与自检(非官方评分标准)

自检要点:① 三套都给出具体追问;② 区分题设事实与风险推断,不把“没提到”当成“没做”;③ 解释员工不知情带来的透明度、许可核查与权力不对称问题;④ 给出改进措施。

① 三次 PAUSE:碰数据前核查原许可和使用依据是否覆盖离职预测,不能仅凭二次使用就断言不被允许。交出结果前检查晋升影响与告知机制;决定产生后追问申诉和人工复核。题面未给申诉制度,但员工不知情已妨碍有效质疑。

② 四步工作流:JUSTIFY 追问刷卡记录为何能代表离职意向,通勤、育儿、远程办公等都是需排查的混杂因素。DOCUMENT、TEST、QUESTION 的执行情况题面未提供,应索取记录、验证结果与复审机制,不能直接断言全部缺位。

③ 三个 P:PEOPLE 是全体员工,其中受影响最深的往往最没有发言权;POWER 的不对称在这里最尖锐,分数被单向用于对员工不利的决定;PROOF:题面未提供评估证据,应追问分组性能与验证方法,不应编造一个整体准确率。

结论:可从第一次 PAUSE 核查新用途,也可从 JUSTIFY 质疑代理指标,或从 POWER 追问晋升决定权。三者没有唯一先后顺序。现有信息不足以支持照常使用;应先补齐告知、用途核查、验证与有效申诉。

闪卡自测

1. integrity 的两个维度分别叫什么?各有哪三个关键词?

01 Moral character in action:HONESTY、PRINCIPLE、CONDUCT,朝外。02 Wholeness within:UNITY、COHERENCE、SELF,朝内。两者不可分割,只答一半不完整(p.4)。

2. 为什么「内在完整」不等于从不动摇?

课件明确写了它并不意味着从不产生疑问。它要求的是价值观之间不互相打架、私下的自己与公开的自己对得上,怀疑与追问不违反这一点(p.5)。

3. Andrea Lessing 案例里两个数字的比例说明什么?

$1,000 只占 $42,000 的约 2.4%,且出现在选择之后。回报顺序是分析动机的线索,不足以证明全部动机;事前有奖励也不自动否定 integrity(p.8)。

4. 动手之前要定的四件事是什么?

purpose、permissions、provenance、fitness for use。一句话概括是数据集本身不构成行动许可(p.14)。

5. 哪三种情形要重新做一次伦理判断?

二次使用、数据关联、对外共享。三者都属于新的用途,上一次取得的许可覆盖不到(p.15)。

6. 隐私保护的三层是什么?说明去标识时最容易过度承诺的是什么?

GOVERN(治理边界)→ CONTROL(访问控制)→ DE-IDENTIFY(去标识)。最容易过度承诺的是去标识的强度,课件要求同时说明它对准确率的影响,别把「已匿名」讲成绝对安全(p.16)。

7. 数据护照的四项是什么?哪一项最常被写成空话?

Origin、Boundary、Transformation、Limitations。最常写成空话的是 Limitations,正确写法是明确指出这份数据不能支撑什么结论(p.17)。

8. 三句压力话分别不等于什么?标准回应是什么?

「讲清楚一点」不等于可以抹掉不确定性,「快一点」不等于可以牺牲有效性,「大家都同意」不等于可以放弃独立判断。回应是走 ethical escalation path,条款引 E.1 到 E.4(p.20)。

9. 部署后的三段义务是什么?其中最常被忽略的是哪一段?

BEFORE 验证、DURING 监测、AFTER 纠正或退役。最常被忽略的是退役——一个已经不适用的模型继续在跑,责任仍在维护方(p.21)。

10. p.23 的六个形容词是什么?

PURPOSEFUL、MINIMAL、PROTECTED、TRANSPARENT、VERIFIABLE、ACCOUNTABLE。它们是第二节全部动作的压缩版,可以当作交付前的自查表(p.23)。

11. 什么是 recourse?为什么它把技术问题变成社会问题?

被系统判定影响的人能不能申诉、能不能要求复核。模型的准确率是技术指标,而有没有申诉通道决定了错误落到人身上之后还有没有出口,所以同一个模型在不同制度环境里的伦理评价不同(p.26)。

12. 三个安静的决定点是哪三个?课件对它们的要求是什么?

收集什么、怎么打标签、拿什么测试。要求是这三处都要被记录、命名、检查,它们不显眼却决定了后面全部结果(p.28)。

下一讲

这一讲把职业动作清单发到手上,接下来要练的是把它套到具体学科的场景里,直到能对着一个陌生系统说出该在哪一步停下来。

下一讲的通俗笔记上完课会补,先回 DSAI5T09 课程页

个人整理的学习笔记,不是官方材料;数字与结论以课件和讲师为准。