Evaluating OpenAI's Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks
Evaluating OpenAI’s Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks
评估 OpenAI 的隐私过滤器:跨语言、跨领域的个人身份信息(PII)检测(基于 42 个基准测试)
Abstract: We present the first independent, systematic evaluation of OpenAI’s Privacy Filter (OPF), a 1.5B-parameter bidirectional PII detector, across 42 synthetic benchmarks spanning 22 languages and 5 domains.
摘要: 我们对 OpenAI 的隐私过滤器(OPF)进行了首次独立且系统的评估。OPF 是一个拥有 15 亿参数的双向 PII(个人身份信息)检测器,本次评估涵盖了跨越 22 种语言和 5 个领域的 42 个合成基准测试。
Zero-shot, OPF achieves F1=0.855 on AI4Privacy and 0.464 on SPY medical, outperforming Presidio (0.431, 0.273) and XLM-RoBERTa (0.269, 0.111) on PII-annotated benchmarks; on multilingual NER, XLM-RoBERTa leads OPF on all 13 Indic and non-Latin languages.
在零样本(Zero-shot)测试中,OPF 在 AI4Privacy 上达到了 F1=0.855,在 SPY 医疗数据集上达到了 0.464,表现优于 Presidio(0.431, 0.273)和 XLM-RoBERTa(0.269, 0.111);但在多语言命名实体识别(NER)任务中,XLM-RoBERTa 在所有 13 种印度语言和非拉丁语系语言上的表现均领先于 OPF。
GPT-4o leads on medical, legal, and financial PII (SPY: 0.643 avg, Gretel: 0.527), while OPF leads on structured synthetic PII (0.71 avg) and customer support (0.60).
GPT-4o 在医疗、法律和金融领域的 PII 检测中处于领先地位(SPY 平均 0.643,Gretel 0.527),而 OPF 在结构化合成 PII(平均 0.71)和客户支持场景(0.60)中表现更优。
OPF degrades sharply when PII is embedded in narrative prose: F1=0.04—0.57 on NER benchmarks and collapse for non-Latin scripts (Arabic: 0.04, Cyrillic: 0.03).
当 PII 嵌入在叙述性文本中时,OPF 的性能会急剧下降:在 NER 基准测试中 F1 分数仅为 0.04–0.57,且在非拉丁脚本语言中几乎失效(阿拉伯语:0.04,西里尔字母:0.03)。
Error analysis shows OPF is strongest on structurally regular PII types (email: 0.78, phone: 0.76) and weakest on culturally variable ones (person: 0.40, address: 0.49), and is recall-biased on customer-support and medical/legal PII (P=0.31—0.54, R=0.70—0.85); global precision spans 0.31—0.86 across all domains.
错误分析显示,OPF 在结构规则的 PII 类型(电子邮件:0.78,电话:0.76)上表现最强,而在文化差异较大的类型(人名:0.40,地址:0.49)上表现最弱;在客户支持和医疗/法律 PII 检测中,该模型存在召回率偏向(精确率 P=0.31–0.54,召回率 R=0.70–0.85);在所有领域中,其全局精确率范围为 0.31–0.86。