挑战

我们如何帮助市议会快速可靠地对市政全体会议记录进行匿名化处理,以保护个人数据、方便会议记录的发布并确保符合相关法规?

背景和问题

AOC为地方政府提供数字化服务,这些服务通常涉及发布包含潜在敏感内容的行政文件。在此背景下,发布前对个人数据进行匿名化处理是确保遵守数据保护法规并降低个人隐私风险的关键要素。

其中最 representa这些是市政全体会议的会议记录,地方实体必须主动在门户网站上公布这些记录。 transparència根据第 19/2014 号法律, transparència获取公共信息和良好治理。直到2024年才发布。 超过8.000场全体会议 在门户网站上 transparència 的 AOC。

这些会议记录可能包含无需公开的个人数据,例如个人姓名、身份证件、地址、电子邮件地址或银行账户信息。他们的审查 这需要区分哪些信息应该公开,哪些信息应该保密,以保护受影响个人的权利。这项决定不仅取决于数据类型,还取决于数据在文档中的上下文。这是一项需要时间、法规知识和严谨的法律判断的任务。

例如,全体会议上当选官员的姓名无需匿名化处理,而制裁决议中受影响者的姓名则需要匿名化处理。同样,出生日期属于个人数据,通常必须匿名化处理,而行政行为的日期则属于必须公开的信息。

当手动完成此过程时, 这会增加相关团队的工作量,也会增加一些个人数据在非自愿情况下泄露的风险。这可能对遵守《通用数据保护条例》(GDPR)产生影响。此外,一旦发现个人数据被不当发布,相关文件必须撤回、更正并发布新版本,这是一个耗时的过程,AOC几乎每周都必须处理。

在此背景下,AOC 在 2025 年考虑人工智能技术是否可以支持这一过程,帮助市政工作人员识别需要匿名化的个人数据,并始终保持对最终决定的人工监督。

建议的解决方案

为了应对这个问题,AOC 启动了一项概念验证 (PoC),以验证生成式人工智能是否可以在市政全体会议记录发布到门户网站之前自动对其进行匿名化处理。 transparència.

该计划探索如何将生成式人工智能解读文档上下文的能力与人工监督相结合,旨在减少与此过程相关的工作量,最大限度地降低个人数据泄露的风险,并确保遵守数据保护法规。

其目的并非取代行政机关的法律标准,而是 提供支持工具,该工具可自动检测个人数据并提出匿名化建议,随后由人工验证匿名化结果后再发布文档。 这种方法既能让你利用人工智能的优势,又能保持对最终决策的人为控制。

该概念验证系统被设计成一个风险最小的系统:人工智能不会对人做出自动决策或影响其权利,而只是作为一种辅助工具,在发布前转换文档。

解决方案是什么?

概念验证包括一个云网络平台,该平台使用生成式人工智能模型来识别和匿名化全体会议中包含的个人数据。

与仅基于预定义模式的传统系统不同, 平台会解读文档的上下文。 区分哪些信息应当公开(例如与民选官员或机构活动相关的信息)和哪些信息应当受到保护(因为其属于个人数据)至关重要。这种能力尤为重要,因为信息是否匿名化往往取决于其出现的语境,而不仅仅是数据类型。

该解决方案融合了多种机制,以确保流程的质量和可靠性:

  • 个人数据的上下文检测基于生成式人工智能。
  • 白名单允许将某些术语从匿名化中排除,以避免过度匿名化。
  • 人工监督 (“人在回路”因此,系统仅提供匿名化建议,用户在发布文档之前需要审核和验证这些建议。
  • 可追溯性和可解释性记录每次匿名化过程中应用的标准,以便该过程可审查和可审计。

功能?

匿名化过程分为四个简单的步骤:

  1. 用户将文档(PDF 或 DOCX)上传到平台。
  2. 选择您要应用的匿名化标准(姓名、身份证号、地址、日期、电话号码、银行账户等),然后开始该过程。
  3. 该系统分析文档,解读信息上下文,并生成匿名化文档的建议。为此,它会根据选定的标准识别需要匿名化的个人数据,并使用掩码将其隐藏。
  4. 用户查看结果,接受或修改生成的掩码,如果检测到未匿名化的个人数据,可以创建新的掩码,最后下载准备发布的文档。

概念验证结果

概念验证已通过以下方式得到验证: 9个市政当局提供的52份文件此外,AOC 在解决方案开发过程中还进行了多次内部测试。验证过程能够评估匿名化的质量以及平台在实际使用场景中的运行情况。

所得结果证实了该方案在技术和功能上的可行性,以及基于生成式人工智能与人工监督相结合的模型的有效性。具体而言,验证结果表明:

  • 该平台整体准确率达到96%。也就是说,当系统识别出需要匿名化的数据时,通常会正确地进行匿名化处理,从而减少了审查错误检测结果的必要性。
  • 将个人数据检测的准确性和覆盖范围结合成一个单一质量指标的总体 F1 指标超过 90%。 在最后eres PoC迭代的整体质量水平已达到95%以上。
  • 人工智能与人工监督相结合 这是一个有效的模型,可以在发布文档之前减少人工工作量,同时保持必要的保证。

概念验证还有助于确定在最终部署到生产环境之前需要解决的主要挑战:

  • 提高检测覆盖率(记得) 减少某些个人数据可能无法匿名化的情况,尤其是在结构复杂或异构的文档中。
  • 改进解决方案架构 为了提高其可扩展性、性能和效率,使大量管理机构能够可持续地共享服务。
  • 继续训练和完善模型 基于已获得的结果和使用真实文档进行的新验证,并结合用户评论过程中产生的知识。

从这个意义上讲,概念验证也让我们能够定义解决方案架构的演进方向。当前版本使用单个高容量生成式人工智能模型来解决整个匿名化过程,这种方法足以验证解决方案的可行性,但对于大规模部署而言效率不高。预期演进 将个人数据的识别与基于上下文决定哪些数据应匿名化分开。这样,每个阶段都可以使用最合适、最高效的人工智能模型。这种演进将提升未来共享服务的可扩展性、性能和可持续性。

总体而言,概念验证证实了这种方法的可行性,并为继续改进解决方案,以期未来在生产环境中部署奠定了坚实的基础。

资源与合作

该概念验证是由负责项目职能领导的 AOC、负责开发平台和分析结果的技术公司 OMNIOS 以及 9 个市议会共同开发的,这些市议会提供了真实文件以在实际环境中验证该解决方案。 representa使用。

自设计之初,该平台就按照以下原则构思: 安全原则 transparència可追溯性和人工监督 专门针对应用于公共部门的人工智能系统,旨在探索一种匿名化模型 人工智能辅助 这可以发展成为未来地方政府的共享服务。

对本地实体的价值

概念验证凸显了生成式人工智能在支持需要大量文件审查和谨慎法律判断的行政流程方面的潜力。如果该解决方案发展成为共享服务,将为地方政府带来显著效益:

  • 降低个人数据意外泄露的风险最大限度地减少发布不应公开的信息的可能性。
  • 节省时间,提高效率 自动化大部分数据识别过程 个人化和减少人工审核。
  • 匿名化标准应用的一致性更高促进各级政府之间采取更加协调一致的政策。
  • 加强可追溯性和审计方面的保障由于对已进行的匿名化处理和所应用的标准进行了登记。
  • 能够持续改进解决方案结合用户输入和日益强大的人工智能模型的进步。

结论

概念验证表明,基于生成式人工智能的工具在技术和功能上是可行的,该工具支持在发布市政全体会议记录之前对其进行匿名化处理。

所得结果表明,自动检测与人工监督相结合是一种合适的方法,既能减轻地方实体的工作量,又能降低个人数据泄露的风险,同时还能在这种性质的过程中保持必要的保障。

概念验证还帮助我们确定了在正式部署前需要改进的主要领域,尤其是在复杂文档中识别特定类型的个人数据以及将解决方案与AOC服务集成方面。概念验证为项目的持续发展奠定了坚实的基础,并有助于评估其未来转型为地方政府共享服务的可能性。

项目状态

已进行概念验证,并验证了其潜力。 该计划的延续性正在通过开展范围更广的试点项目来实现。

更多信息

AOC博客:

演示文稿和文章:

影片: