重複レコード削除
指定したフィールドの値が重複しているレコードを検出して1つにまとめ、不要な重複レコードを除外します。
特徴
- データのクレンジング: 同じ顧客IDや製品コードを持つ重複レコードを1つにまとめ、正確な顧客台帳やマスターデータを整備します。
- 複数項目の組み合わせによる重複判定(名寄せ): 「顧客名」と「メールアドレス」など、複数のフィールドを組み合わせて重複チェックを行えます。選択したすべての項目が一致するレコードのみを重複とみなすため、実務に即した正確な名寄せに対応します。
- 最新・最適データの保持: 登録日時や更新日時などを基準に、最も新しいレコードや、特定の優先条件(金額が最大など)に合致するレコードだけをピンポイントで残します。
- 分析や結合処理の精度向上: アプリ結合やデータ集計を行う前段階で不要な重複レコードをあらかじめ取り除いておくことで、処理の重複や集計ミスの発生を防ぎ、分析の精度を高めます。
機能
設定項目詳細
| 設定大項目 | 設定小項目 | 説明 | ルール |
|---|---|---|---|
| ノード設定 | タイトル | フロー編集画面および実行ログ等に表示されるノード名です。 | 任意の名称を入力します。(初期値はプロセッサー名が入ります) |
| ノード設定 | 説明 | ノードの補足説明です。 | 任意で入力します。(初期値は既定のプロセッサー補足説明が入ります) |
| 重複を判定するフィールド | 重複を判定するフィールド | 重複しているかどうかを比較する基準のフィールド(複数選択可)を選択します。 | 必須(1つ以上選択) |
| 重複を判定するフィールド | 大文字/小文字を区別 | 各重複判定フィールドの右側にあるチェックで、アルファベットの「ABC」と「abc」を異なるデータとして厳密に判定するかを指定します。 | 任意(判定フィールドごとに設定可能) |
| 残すレコードの優先順位 | 優先順位(ソート) | 重複が見つかったレコードの中から、どのレコードを残すかを指定します。並び替えた結果、先頭(一番上)にくるレコードが最終的にデータとして保持されます。 | 任意。設定しない場合は、元々のレコードの並び順(通常は取得したレコードの順序)で最も上にあるレコードが優先して残ります。 |
重複とみなされるデータ形式
複数選択(チェックボックスや複数選択)や、ユーザー選択などの複数選べる項目を重複判定に選んだ場合、選択しているすべての値が完全に一致しているものが重複として判定されます。
使い方
設定手順
データフロー編集画面で「プロセッサーを追加」>「重複レコード削除」を選択し、以下の手順で設定を行います。
- 重複を判断する基準フィールドを選択する:
右側の設定パネルから、重複判定の基準にしたいフィールドにチェックを入れます。必要に応じて、フィールドごとに「大文字/小文字を区別」のチェックボックスにチェックを入れます。
- 残すレコードの優先順位を設定する:
「重複時に残すレコードの優先順位」セクションで、残したいレコードが一覧の先頭に並ぶように、基準とするフィールドと並び順(昇順・降順)を設定します。
動作イメージ
動作イメージはフロー編集画面で確認可能です。
注意事項
- 表記ゆれについて: 全角・半角の違いや「株式会社」と「(株)」などの表記ゆれがある場合は重複として判定されません。あらかじめ「データ変換」などで表記を統一してから、本プロセッサーによる重複排除を適用してください。
- テーブルの指定について: テーブル全体(テーブルそのもの)を重複の基準に選ぶことはできません。テーブルの中にある特定の項目で判定したい場合は、事前に「テーブル分解」を実行してテーブルをバラバラにするか、テーブル内の特定項目(列)を基準に設定してください。
