OPF 日本語適用性 実証実験 — 評価レポート

手法詳細: OpenAI Privacy Filter

手法詳細: OpenAI Privacy Filter (OPF)

📑 凡例: [n]=一次情報の事実(出典)/🔎=実測・解釈/📘=ドキュメント由来。サマリは 評価レポート を参照。

概要

📘 双方向トークン分類+Viterbi スパン復元の小型モデル(1.5B総 / 50M アクティブ MoE・128k ctx)[1]。テキスト中の PII を検出・マスクする。生成モデルではなく分類器。検出は固定 8 カテゴリ: private_person / private_address / private_email / private_phone / private_url / private_date / account_number / secret [1]。Apache-2.0、オンプレ実行可。

CLI / 学習・評価仕様(ソース確認)

詳細は docs/findings-opf-cli.md。要点:

環境・落とし穴

定性スモーク(参考・正式B0ではない)

CPU 実行(opf --device cpu)の手動確認:

入力(要約) 検出 見逃し
佐藤花子(72歳)・東京都千代田区・電話・受付番号A-0012 氏名・住所・電話 72歳・受付番号
山田太郎・2025年1月3日・○○病院・鈴木医師 山田太郎・鈴木(氏名部) 和暦日付・病院名
田中一郎, tanaka@example.co.jp, 03-1234-5678 氏名・メール・電話

OPF qualitative smoke coverage

🔎 基本PII(氏名/住所/電話/メール/西暦日付)は日本語でも有効。業務ID・施設名・年齢・和暦日付は素では見逃し → B1(後処理)/B2(追加学習)の改善対象。

出典