数据隐私旨在保护个人在自身信息的收集、处理、共享、保留和删除方式方面的利益。它涵盖组织管理实践、技术保障措施,以及规范数据适当用途的规则。隐私的范围比保密更广:即使信息由获授权的主体处理,并受到保护以防止未经授权的访问,仍然可能产生隐私风险。该领域与网络安全和数据治理有所交叉,但关注的是对人的影响,而不仅仅是系统的安全。(nccoe.nist.gov)
个人信息与隐私风险
个人数据通常指与已识别或可识别的个人有关的信息,不过其法律定义各不相同。姓名和身份证件号码属于直接标识符;位置记录、在线标识符以及多种属性的组合,也可能使某个人能够被识别。信息并不一定会因为姓名被移除,就不再属于个人信息。根据欧盟规则,判断个人是否可被识别,取决于识别此人时合理可能采用的手段。(eur-lex.europa.eu)
一些法律框架将需要额外保护的敏感个人数据单独列为一类。加利福尼亚州的法定定义包括精确地理位置、遗传信息、某些金融账户凭据,以及与健康或宗教信仰有关的信息。其个人信息定义还涵盖用于构建消费者偏好和特征画像的某些推断信息。(oag.ca.gov)
隐私风险贯穿数据的整个生命周期,可能包括非自愿的信息披露、未预期的二次使用、自主权受损、歧视或经济损害。数据泄露是风险来源之一,但隐私问题不一定涉及泄露:组织按计划开展的数据处理本身就可能对个人造成不利影响。因此,美国国家标准与技术研究院(NIST)将隐私风险管理视为网络安全风险管理的补充,而不是可以与之相互替代的工作。(nist.gov)
原则与组织治理
数据保护框架中反复出现若干原则。目的限制要求数据收集及后续使用与明确规定的目的相联系。数据最小化将处理范围限定为实现这些目的所必需的信息。准确性原则要求相关信息保持准确,存储期限限制原则则约束数据的保留时间。透明度原则要求以易于理解的方式提供处理活动的相关信息,问责原则则关注组织能否证明其做法符合适用义务。欧盟的数据保护框架明确认可了这些原则。(commission.europa.eu)
组织层面的落实措施包括建立数据及处理活动清单、明确职责、制定保留和删除程序、开展员工培训,以及监督服务提供商。隐私影响评估考察处理活动可能如何影响个人,以及哪些控制措施能够降低这些风险。这类评估不同于安全评估,因为它还会考察预定的数据收集和使用所带来的后果。(nvlpubs.nist.gov)
隐私保护设计从最早的开发阶段起,就将保障措施纳入系统和业务流程。保护隐私的默认设置着眼于数据收集、可访问性和使用的初始配置,而不是要求个人事后更改设置。这些做法结合了技术措施和组织措施,并非只是给已经完成的产品添加功能。(eulisa.europa.eu)
法律框架与个人权利
数据隐私与法律和人权密切相关。欧盟的《通用数据保护条例》(GDPR)自2018年5月25日起适用,为其适用范围内的处理活动规定了义务,并确立了访问、更正,以及在特定条件下删除数据和数据可携带等权利。同意只是处理数据的一种合法依据;其他依据还包括履行合同所必需、履行法定义务等。这些权利和合法依据都有各自的条件与例外,并非对所有活动都以相同方式适用。(eur-lex.europa.eu)
在加利福尼亚州,《加利福尼亚州消费者隐私法》赋予居民针对其适用范围内企业的相关权利,包括了解所收集的信息、请求删除或更正信息,以及拒绝出售个人信息或为跨情境行为广告而共享个人信息。《加利福尼亚州隐私权法》修订了这一框架,并自2023年1月1日起引入额外保护。适用范围及例外情况取决于法定定义。(oag.ca.gov)
美国联邦层面的保护还包括针对特定行业的规则。《健康保险可携性与责任法案》(HIPAA)隐私规则规范适用实体及其业务伙伴持有的受保护健康信息;它并不涵盖所有持有健康相关数据的组织。《儿童在线隐私保护法》及其实施规则,规范特定的、在线收集13岁以下儿童个人信息的活动。(hhs.gov)
技术保护及其局限
密码学及其加密技术有助于保障信息的机密性。访问控制限制哪些人能够检索或修改信息,审计记录则有助于追溯活动。这些保障措施可以减少未经授权的访问,但其本身无法判断某项获授权的使用是否恰当。(nvlpubs.nist.gov)
去标识化旨在消除或减弱记录与个人之间的关联。相关技术包括去除标识符,以及在保留有用分析信息的同时对属性进行泛化。其有效性取决于数据本身、发布条件和可获得的辅助信息。重新识别会恢复数据与个人之间的关联,因此,移除明显的标识符并不一定能消除信息披露风险。(csrc.nist.gov)
差分隐私提供了一种数学框架,用于限定个人向数据集提供数据所带来的隐私损失。其实现通常使用经过校准的随机性,限制发布结果所透露的信息。这种保证取决于明确界定的假设、参数和实现方式;它并不意味着每项输出都无害,也不意味着所有隐私义务都已得到履行。(csrc.nist.gov)
机器学习与分布式数据
在机器学习中,隐私问题不仅涉及训练数据的存储。模型和共享的更新也可能透露输入数据的信息。成员推断攻击试图判断某条记录是否参与过训练;重构攻击则试图恢复训练样本的相关信息。(nist.gov)
联邦学习通过多个参与方共同训练模型,而不一定要集中存放各方的原始数据集。参与方转而共享模型更新,但这些更新仍可能暴露隐私信息。安全聚合和差分隐私可以分别应对此类风险的不同方面。它们的有效性取决于对参与方的假设、暴露的信息,以及所考虑的攻击方式。(nist.gov)