第二十一章:塑造高维合成样本
本章造假目标
真实留出集有 1000 条记录,其中 900 条为常见状态、100 条为罕见故障。生成器产出 1000 条记录,标签全是常见状态;按预先冻结的邻域规则,其中 980 条落在真实数据区域内。内部上线标准同时要求生成 precision 不低于 、故障模式覆盖不低于 、TSTR 平衡准确率不低于 ,并且不得精确复制训练记录。当前生成 precision 为 ,故障覆盖为 0;合成数据训练的分类器把全部真实留出记录都判为常见,总体准确率为 ,平衡准确率只有 ;最近邻核查还发现 12 条精确复制。允许从现有评估结果中挑选标题指标,不得重新生成或修改记录。任务是只报告 precision 和 总体准确率,把这批数据包装成“可用”,随后用数据血缘、双向覆盖、分层 TSTR 与隐私审计复原被省略的失败。
先让标题通过,再看完整门槛
所谓合成数据,是生成模型从真实训练集学习一个近似分布,再由这个分布抽取的新记录。可把基本流程写成
它常用于软件测试、仿真、模型训练和受限数据共享。理想目标包含两部分: 要为预定用途保留真实总体 的相关结构,单个训练参与者对发布结果的影响还要受到控制。记录看起来顺眼,只回答了其中很小一部分。
设第 条合成记录是否落入真实数据邻域的指示量为 。章首的 1000 条合成记录中有 980 条满足 ,因此
这个分母只包含已经生成的记录。生成器从未产出的故障不会进入该分母。反过来,以真实留出记录为出发点,检查它们能否在合成数据附近找到覆盖,900 条常见记录得到覆盖,100 条故障记录全未得到覆盖:
总体覆盖率仍有 ,因为常见状态占了真实留出集的九成。上线标准关心故障模式,真正对应门槛的数是最后一个 。
再看下游任务。合成训练集没有故障类。有些分类器会直接拒绝单类别训练;章首管线允许退化为常见类常数规则,于是对真实留出集全部预测“常见”,混淆矩阵为
| 真实状态 | 预测常见 | 预测故障 |
|---|---|---|
| 常见 | 900 | 0 |
| 故障 | 100 | 0 |
总体准确率为
常见状态召回率为 ,故障召回率为 0。二分类平衡准确率给两类相同权重:
最后,将每条合成记录与生成器训练集逐条比对,12 条记录的最近邻距离为 0,精确复制率为
完整验收结果由四项预定条件共同决定:
| 指标 | 门槛 | 当前值 | 结论 |
|---|---|---|---|
| 生成 precision | 通过 | ||
| 故障模式覆盖 | 失败 | ||
| TSTR 平衡准确率 | 失败 | ||
| 精确训练集复制 | 条 | 12 条 | 失败 |
造假动作留下的影子
标题只保留 precision 与 总体准确率,读者会看到两个高分。完整指标卡给出一项通过、三项失败。选择动作没有改动任何记录,也没有改错任何公式;它更换了分母、类别权重和指标身份。冻结指标名称、门槛与否决规则,才能让这类包装失效。
这一组数字提出了全章的四个问题:合成点看起来像真数据,能否推出真实模式已经覆盖?高维距离还能否稳定定义“像”?任务表现由哪个损失函数衡量?没有明显复制,能否推出个体安全?下面依次回答。
数据血缘决定评估是否仍是样本外评估
合成数据流程至少需要区分四份对象:
其中, 用于拟合生成器; 用于选择模型、训练轮数、特征表示和评估超参数; 是只在最终审计中开启的真实留出集; 是冻结生成方案后抽取的合成样本。四者的角色不同:
-
生成器及其早停规则不能根据 的结果反复调整;
-
邻域度量使用的特征变换、距离、邻居数 和阈值应在最终审计前确定;
-
TSTR 模型在 上训练,在 上评估;
-
真实训练、真实测试的基准也在同一个 上计算;
-
复制检查将 与 比较,成员攻击还需准备来源明确的非成员样本。
“留出集”描述的是使用方式。团队每看一次结果便修改生成器、筛选随机种子或重选指标,这份数据就逐步承担了调参集的角色。最终分数仍可由软件准确输出,样本外解释已经被反复反馈削弱。
一张可复核的数据血缘表应记录:每条真实记录进入了哪一份数据、拆分是否按设备或用户成组、时间截点在何处、标签何时生成、预处理参数由哪一份数据估计,以及每个生成版本是否接触过最终留出结果。若同一用户的相邻记录跨越训练集与留出集,随机逐行拆分还会产生实体泄漏;时间数据则常需按时间向前留出。
章首的 、、 和 12 条复制,只有在数据角色与评估规则已经冻结时才具有清楚含义。先整理数据血缘,随后才有资格讨论指标。
生成 precision 与 recall 是两个方向的邻域问题
“落在真实支持附近”需要一套可执行定义。设真实审计样本为
合成样本为
先用冻结的表示映射 把记录送入评估空间,再用距离 比较。令 为 到其第 个真实邻居的距离,计算时排除自身;真实样本的邻域并集为
同理,用合成样本的第 邻域构造
一个常用的有限样本定义为
第一式从合成点出发,询问它能否得到真实邻域接纳;第二式从真实点出发,询问它能否得到合成邻域覆盖。章首的 980 与 900 正是两个相反方向的计数。
这套估计依赖 、、、样本量和预处理。图像任务可能在感知特征空间计算,表格数据可能混合连续变量、类别变量与缺失模式。若在看到结果后更换表示或 ,评估规则也进入了选择空间。报告必须给出完整定义,并用敏感性分析说明合理设置下的稳定性。
还要区分“邻域覆盖”与“密度相同”。两个分布可以占据相同区域,同时在各区域分配完全不同的概率。precision 与 recall 把样本质量和模式覆盖拆开,却没有穷尽联合分布差异。后文的混合分布和两样本检验会补上这一层。
方法来路:为什么要给生成分布定义 precision 与 recall?
分类中的 precision 与 recall 用两个方向区分误报和漏报。生成模型也同时面临两类失败:生成的样本失真,以及真实模式被遗漏。Sajjadi 等人在 2018 年用分布 precision–recall 曲线分解这两类误差;Kynkäänniemi 等人在 2019 年进一步用特征空间中的局部邻域估计样本质量和覆盖。方法的具体版本可以变化,双向提问保留了下来。
总体覆盖会稀释罕见模式,区间刻画抽样精度
设真实类别为 。类别 的生成覆盖率应单独计算:
总体覆盖是类别覆盖的样本比例加权平均:
章首数据因此满足
只要罕见类权重很小,总体覆盖就能在该类完全缺失时保持较高。上线门槛应沿着实际风险分层,例如按故障类型、设备系列、环境条件和严重程度分别报告,必要时对高代价类别设置一票否决。
比例估计还带有抽样误差。若把冻结评估规则下的覆盖指示量视为相互独立的 0–1 观测,可用二项模型描述。
下表采用 Clopper–Pearson 方法给出双侧 区间:
| 比例 | 点估计 | 区间 |
|---|---|---|
| 生成 precision: | ||
| 总体覆盖: | ||
| 故障覆盖: |
观察到 100 次中 0 次覆盖,说明数据与 门槛相距很远。区间上端大于 0,说明有限样本无法把未知覆盖概率钉死在零点。若只需要单侧 上限,数值为
精确计算结果与常用的“零次事件”近似规则 十分接近。
上述二项区间以冻结的生成器和覆盖规则为条件,没有计入重新训练生成器、重抽随机种子、重估表示和邻域所产生的波动。实际评估应在多个训练种子与生成批次上重复;用户、设备或时间段存在聚类时,还要按独立实体重抽样。一个窄区间只能说明当前评估过程的重复波动较小,无法修复目标类别定义错误或指标选择错误。
高维体积让“中间区域”迅速变空
二维散点图会强化一种低维直觉:坐标轴中部应当容纳很多样本。考虑 维单位超立方体 。每个坐标都落入中间一半 的区域,其体积为
当 时,
等价地,一个均匀点位于距离某个边界不超过 的区域内,其概率为
即使独立抽取 1000 个均匀点,中间超立方体的期望样本数也只有
至少出现一个中间点的概率为
这组计算展示了维数灾难的一种几何来源:每一维都保留一半范围,看似宽松;多个坐标条件相乘后,可用体积按指数收缩。有限样本很难均匀铺满高维空间,固定半径邻域也会随维度产生完全不同的覆盖行为。
工程数据通常受守恒关系、控制逻辑和物理机制约束,可能集中在远低于表面维数的结构附近。此时应区分环境维数与内在维数。低维流形、稀疏表示或领域特征能够缓解部分困难,它们都需要由样本外任务和机制检查验证。把数据投到二维并看到一团连续云,仍不足以说明原空间中的空洞已经消失。
距离集中有明确模型边界
设
则
从而
平方欧氏距离的均值与方差为
其变异系数为
时,该变异系数依次为 、约 和 。成对距离的绝对尺度随维度上升,相对于均值的波动逐渐收缩。
这条结论有三重边界。第一,它针对独立标准正态点和平方欧氏距离。第二,它描述随机点对,没有单独给出样本最近距离与最远距离的极限;候选点数怎样随 增长也会影响极值。第三,真实数据的尺度、相关和内在结构会改变几何。因而,该式只支持“距离需要校准”,不足以据此宣布所有高维最近邻都失去意义。
实际计算还要处理量纲。若温度以摄氏度记录、压力以帕记录,一个数值范围大的变量可能支配欧氏距离。标准化可以平衡边缘尺度,却会丢失某些物理权重。Mahalanobis 距离
利用协方差校正方向尺度;当维数接近或超过样本量时, 可能奇异或极不稳定,需要收缩估计、降维或领域约束。学习得到的表示 也会把模型偏好带入距离。每一种选择都应在真实罕见模式上验证。
方法来路:高维最近邻为何成为独立问题?
Beyer、Goldstein、Ramakrishnan 与 Shaft 在 1999 年研究了高维条件下最近邻何时会失去区分力。他们关注的动机来自数据库检索:索引可以更快地找到数值最近点,前提是“最近”仍携带有用差异。后来的距离度量、近似检索和表示学习都在继续处理这个前提。
模式崩溃能保住常见峰并删除长尾
用一个一维例子观察密度层面的遗漏。设真实分布为
其中第二个小峰代表罕见故障。生成器只学到
对一般两成分混合分布,若混合权重为 ,成分均值与方差分别为 、,则
代入本例可得
生成分布 的均值与方差为 0 和 1。全局矩已经暴露差异;在更复杂的数据中,生成器还可能匹配许多边缘矩,同时漏掉联合长尾。
尾部事件提供另一把尺。令 ,则
总变差距离满足
这个下界几乎完整捕捉了被删除的 故障峰。
这里还有一个容易忽略的严谨性问题:正态分布在整条实线上密度都为正, 与 的数学支持集同为 。若只按“是否属于支持集”定义覆盖,两者都会得到满分。有限样本邻域、局部密度、分层标签和分布距离之所以必要,正是因为工程中的“模式覆盖”比集合论支持更细。
Goodfellow 等人在 2014 年提出生成对抗网络,让生成器与来源判别器通过极小极大博弈学习数据分布;理想均衡对应生成分布复原真实分布。有限模型和实际优化可能把大量潜在输入压到少数输出区域,形成模式崩溃。这个失败也会出现在其他生成框架中,所以诊断目标应落在分布结果上,不能只看模型名称。
模式崩溃的统计含义
生成器把多个真实区域映射到少数高概率输出时,常见样本仍可十分逼真,样本多样性与罕见模式同时下降。高 precision 可以与低 recall 共存;相同支持也可以与错误密度共存。评价需要同时观察方向性覆盖、概率质量和实际任务。
两样本检验检查整体差异,降维图只提供线索
边缘表格难以穷举高维联合分布。两样本检验直接提出
最大均值差异(maximum mean discrepancy, MMD)在再生核 Hilbert 空间 中定义为
给定真实样本 、合成样本 和核函数 ,一个总为非负的经验平方量为
核函数 可以理解为两条记录在所选表示中的相似度。前两项汇总真实样本内部与合成样本内部的相似度,第三项汇总跨来源相似度;两种内部结构与跨来源结构不协调时,MMD 会增大。
对高斯核等具有分布刻画能力的核(characteristic kernel),在适当条件下,群体 MMD 为 0 当且仅当 。有限样本检验可反复置换“真实/合成”标签,生成零假设下的参照分布。核带宽、表示空间与预处理影响检验对哪类差异更敏感,必须在查看最终检验结果前冻结。未拒绝 只表示当前检验没有检出差异;样本量不足或核对目标差异不敏感时,两个分布仍可能不同。
另一种办法是给每条记录加上来源标签
再训练一个来源分类器。它在独立测试集上的平衡准确率显著高于 ,说明两类记录存在可学习差异。训练集准确率会混入过拟合,不能充当检验结果。接近 也只说明当前样本量、模型类和特征下没有检出差异;低检验功效仍可能掩住罕见模式。
MMD 与来源分类器回答“两个分布能否区分”。TSTR 回答“合成数据能否训练真实任务”。两个问题使用的标签、损失与训练流程均不同,报告时需要分栏。
PCA、t-SNE 和 UMAP 图可以帮助寻找失真位置。PCA 只展示所选线性方向,局部嵌入还会依赖邻居数、距离和随机种子。高维到二维的映射必然丢失信息;真实与合成点在图上重叠,不能替代正式检验、分层覆盖和机制约束。
方法来路:MMD 为何用于两样本问题?
经典一维检验依赖排序或累计分布,高维数据缺少同样自然的全序。Gretton 等人在 2012 年系统建立核两样本检验:用一组足够丰富的函数寻找两分布期望的最大差异,并通过渐近理论或重抽样确定阈值。它绕开了完整高维密度估计,也把“选什么核”变成可审计的功效选择。
保真度要沿边缘、条件、联合与机制逐层检查
一个整体检验能够发现差异,却未必告诉工程人员差异在哪里。合成数据的诊断应沿数据结构逐层展开:
| 层次 | 核心问题 | 典型检查 |
|---|---|---|
| 边缘 | 单个变量是否合理 | 范围、比例、分位数、尾部、缺失率 |
| 成对 | 两变量关系是否保留 | 交叉表、相关、非线性关系 |
| 条件 | 关键亚组是否完整 | 分层分布、类别覆盖、条件误差 |
| 高维联合 | 组合结构能否区分 | MMD、来源分类器、距离与聚类 |
| 逻辑与机制 | 记录能否由系统产生 | 物理约束、时间顺序、守恒关系 |
| 任务与推断 | 指定用途是否可靠 | TSTR、校准、估计偏差与区间覆盖 |
| 隐私 | 个体影响是否受控 | 复制、链接、成员攻击、差分隐私 |
章首数据在多层同时失败。标签边缘从真实的 变成合成的 ;故障条件分布没有任何合成样本;TSTR 在故障类的召回为 0;12 条训练记录又在个体层面重现。只展示常见状态内部的均值和二维投影,相当于把失败条件排除后再评价剩余区域。
特征重要性也要放回这一层次。置换重要性衡量特定模型在特定测试分布上对一个变量的依赖。高度相关变量可以互相替代,重要性会被分摊;不同模型还会利用不同表示。真实与合成模型的重要性排序接近,只能作为条件关系的一条线索。样本外性能、概率校准、亚组误差和领域机制仍需单独核查。
对推断用途还要追问 estimand。合成样本可能近似观察联合分布,却没有自动恢复干预机制;同一观察分布可以对应不同因果结构。若用途是回归系数、风险差或因果效应,应在重复模拟或受控真实基准上检查偏差、标准误与区间覆盖,不能把记录级相似直接传递为推断有效。
TSTR 要和真实基准在同一留出集上比较
Train on Synthetic, Test on Real(TSTR)把合成数据用于训练,把真实留出数据用于最终评估。设学习算法为 ,则
对损失函数 ,两种训练来源在同一真实留出集上的风险为
定义效用损失
表示合成训练带来额外风险。两条流程应使用相同模型族、调参预算和真实测试集;训练样本量不同则应补充学习曲线。章首没有给出 ,所以完整报告可以判定 TSTR 未过门槛,却还不能量化它相对真实训练的性能损失。
Train on Real, Test on Synthetic(TRTS)交换训练与测试来源。真实模型在合成测试集上表现极高,可能说明合成任务过于平滑;表现很低则提示条件关系被改变。TRTS 的测试分布由生成器决定,无法代替真实世界泛化评估。
类别不平衡时,损失函数决定结论。 类平衡准确率为
章首模型的普通错误率为 ,平衡错误率为
若漏报一个故障的代价为 10、误报一个常见状态的代价为 1,平均成本为
个成本单位。 准确率把 100 次高代价漏报压缩成一个看似温和的比例。
故障召回、specificity、precision、PR–AUC、概率校准和决策成本回答不同问题。硬分类混淆矩阵没有提供概率预测,因而无法计算 Brier 分数或校准曲线。指标应由使用场景预先确定,后续指标用于诊断,不能临时替换上线门槛。
方法来路:TSTR 为何被提出?
合成记录“看起来像”很难保证它们能训练出可用模型。Esteban、Hyland 与 Rätsch 在 2017 年研究合成医疗时间序列时,明确比较了合成训练、真实测试以及真实训练、合成测试。这个设计把评估重心移到下游任务,同时也留下清楚边界:任务没有覆盖的结构仍需其他检验。
精确复制只是隐私审计的第一层
对合成记录 ,定义它到训练集的最近距离
章首有 12 条合成记录满足 。除了报告 12/1000,还应报告对应多少条不同训练记录、每条被复制多少次、是否属于罕见组合,以及离散变量与连续变量分别使用了什么匹配规则。四舍五入、缺失编码和重复采样都可能影响“精确”的定义。
距离审计还需一个非成员参照。设
若合成点系统性地更贴近训练成员,生成器可能发生局部过拟合。训练集与非成员参照集的样本量和群体构成应尽量匹配,因为候选点越多,最近距离自然越小。低基数离散表中也可能偶然出现精确相同的记录,所以“距离为 0”本身还要结合非成员基线解释;章首的 12 条仍然直接违反零复制门槛。最近距离相同也无法覆盖所有攻击:对手可以利用密度、生成频率、罕见属性组合或外部数据库链接。
成员推断把隐私问题写成一个二元检验。给定候选记录 ,攻击器输出 表示“认为它属于训练集”。定义
一个直观的攻击优势为
随机猜测的期望优势为 0,完美攻击为 1。在成员与非成员先验各占一半时,攻击准确率满足
例如 、 时,优势为 ,攻击准确率为 。平均攻击结果还应按罕见群体分层,因为独特记录更容易受到链接和成员推断。
攻击模型的阈值需要独立校准,最终 TPR、FPR、ROC 曲线和低 FPR 区域表现应在未用于调攻击器的数据上报告。一次较弱攻击没有成功,只能给出当前攻击设置下的经验结果。成员推断、属性推断、身份链接和内容重建各有不同威胁模型,发布方应说明攻击者能看到合成样本、生成器接口、模型参数还是辅助数据。
适用边界:零复制与零泄露没有等号
删除精确重复可以满足记录级去重规则,近似复制、罕见组合和密度过拟合仍可能泄露训练成员。反过来,形式化隐私机制也未必禁止偶然生成一条与输入相同的记录。复制门槛、经验攻击与形式保证需要分别报告。
差分隐私限制单条记录对输出分布的影响
设相邻数据集 与 只相差一个个体。随机机制 满足 -差分隐私,如果对所有相邻 和所有可测输出集合 都有
这条不等式要求:加入或移除一个人的记录,任何输出事件的概率都只能在受控范围内变化。 越小,乘法差异越受限制; 允许极小概率的额外偏离,应结合样本量、发布次数和威胁场景解释。
例如 、 时,若某输出事件在 下的概率为 ,它在相邻 下至多为 。相邻关系是对称的,同样约束也能交换 使用。这个保证覆盖所有输出事件和任意后处理,比列举若干经验攻击更广。
差分隐私还有两项实践性质:
-
后处理:只使用差分隐私输出进行的随机或确定性变换,不会额外放大其隐私参数;
-
组合:同一数据上的多次训练、查询或发布会累积隐私损失,不能只引用单次运行的参数。
训练一个差分隐私生成器,需要说明相邻关系按记录还是按用户定义、梯度裁剪规则、噪声机制、隐私会计方法、总 、 和所有发布次数。只给合成结果做去重,不会自动产生差分隐私保证;只说“使用了噪声”,也缺少可核查参数。
隐私与长尾效用之间常有张力。罕见模式由少数个体支撑,对裁剪、噪声和正则化更敏感;过度追求表面逼真又可能促使模型记忆独特记录。这个权衡应通过分层覆盖、TSTR、攻击实验与正式隐私预算共同展示,不能压缩成单一“隐私分数”。
方法来路:差分隐私解决了什么问题?
传统匿名化规则依赖攻击者知道什么,外部数据增加后保证容易改变。Dwork 等人在 2006 年提出差分隐私框架,把保护目标写成相邻数据库输出分布的稳定性。它控制单个参与者对发布结果的可辨识影响,也把噪声、查询敏感度和重复发布纳入同一套可组合计算。
冻结指标卡,让四项目标各自接受验收
回到章首,完整指标卡应保留指标名称、分母、门槛和否决关系:
| 指标 | 分母与含义 | 门槛 | 结果 |
|---|---|---|---|
| 生成 precision | 1000 条合成记录中落入真实邻域的比例 | ||
| 故障覆盖 | 100 条真实故障中得到合成邻域覆盖的比例 | ||
| TSTR 平衡准确率 | 常见与故障召回率的等权平均 | ||
| 精确训练集复制 | 与 完全相同的合成记录数 | 12 | |
| 普通准确率 | 1000 条真实记录中的正确分类比例;补充指标 | 无 |
上线规则是四项门槛的交集:
当前结果不属于集合 。 普通准确率没有出现在上线条件中,把它放入标题不能替换平衡准确率。
一份可审计的合成数据报告至少保存:
-
训练、调参与最终留出数据的谱系和实体拆分规则;
-
生成器版本、随机种子、训练停止点与失败运行;
-
评估表示、距离、邻域参数和所有预处理;
-
总体与分层 precision、recall 及其抽样区间;
-
边缘、条件、联合、逻辑与机制检查;
-
MMD 或来源分类器的独立测试结果与检验功效说明;
-
TSTR、TRTS、真实训练基准、类别指标和决策成本;
-
精确与近似复制、成员攻击、罕见组合和链接风险;
-
差分隐私的相邻关系、预算、会计与组合发布记录;
-
预定用途、禁止用途、上线门槛和每项否决理由。
本章的标题包装利用了两次替换:用从合成点出发的 precision 代替从真实故障出发的 coverage,用按样本比例加权的准确率代替按类别等权的平衡准确率。复制结果则被直接省略。指标卡把方向、分母和门槛固定下来,选择空间便失去藏身处。
静态记录的联合分布通过验收后,时间顺序仍可能留下更强的模板痕迹。下一章将把检查单位从一行高维记录移到一串带时间戳的行为流水。
本章知识链
本章用同一批合成数据贯穿四类目标。生成 precision 从合成点出发衡量样本逼真度,生成 recall 从真实点出发衡量模式覆盖;总体覆盖会按类别规模稀释罕见故障,分层比例与区间提供更清楚的证据;高维中部体积按维度指数缩小,特定正态模型下平方距离的相对波动按 收缩;模式崩溃可以保住常见峰并删除长尾,相同数学支持也无法保证密度相同;MMD 与来源分类器检查整体分布差异,降维图承担探索作用;TSTR 必须在同一真实留出集上与真实训练基准比较,并按类别和代价选择损失;精确复制只是隐私审计起点,成员攻击用 TPR、FPR 与攻击优势量化经验风险;差分隐私用相邻数据集的输出稳定性给出形式保证,并受后处理与组合规则约束。章首 precision 通过,故障覆盖 、平衡准确率 和 12 条复制均失败。完整指标卡据此拒绝上线。
思考与练习
-
复算章首生成 precision、总体生成 recall、常见与故障生成 recall、普通准确率、平衡准确率和精确复制率,逐项写明分母与评估方向。
-
对 和 ,使用 Clopper–Pearson 方法计算双侧 区间;再计算 0/100 的单侧 上限。说明这些区间没有包含哪些生成过程波动。
-
计算 时 中部区域 的体积。若抽取 1000 个均匀点,再计算中部区域的期望样本数。
-
对 ,计算 中独立点对平方欧氏距离的变异系数。举出一个变量量纲使欧氏距离失真的工程例子。
-
复算混合分布 的均值与方差,并用事件 验证它与 的总变差距离至少约为 。
-
设一维真实点为 ,合成点为 ,所有点的邻域半径固定为 。按本章双向定义计算生成 precision 与 recall,并指出遗漏的是哪个真实模式。
-
线性核 下,经验 MMD 只比较样本均值。构造两组均值相同、分布形状不同的一维样本,说明核选择为什么影响检验功效。
-
解释来源分类器与 TSTR 分类器的标签各是什么。分别说明高准确率在两个任务中揭示什么。
-
若故障漏报代价为 20、常见状态误报代价为 2,复算章首全预测常见规则的平均成本。再说明普通准确率为何没有表达该成本结构。
-
某成员攻击的 、。计算攻击优势;在成员与非成员先验各半时计算攻击准确率。
-
某机制满足 -差分隐私。若事件 在相邻数据集 下的概率为 ,用定义给出它在 下的上界。说明重复发布为什么需要隐私会计。
-
为含 罕见故障的工业数据写一页合成数据验收卡,至少包含数据血缘、分层覆盖、真实训练基准、决策成本、成员攻击和正式隐私参数。