重複の排除

重複の排除

お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の英語版を参照してください。




[重複を削除]の加工を使用すると、データから重複データを削除できます。削除方法には、行単位と列単位の2種類があります。

行単位

この方法では、重複したデータを含む行が削除され、重複のない行のみがデータセットに残ります。

行単位で重複を削除するには

1. [加工]メニューをクリックし、[重複を削除]をクリックして、[行単位]を選択します。

2. 重複した行を削除する際、重複の識別方法を調整するために、次の設定を有効にできます。

大文字と小文字を区別しない] - 大文字と小文字を同じ文字として扱い、重複とみなします。

空白を無視する] - 単語の先頭や末尾の半角スペース、および単語間の連続する半角スペースを無視し、重複とみなします。

重複データのフラグを設定する] - 新しい列で重複データにフラグを設定します。後から、新しく追加された列を使用して重複データを除外できます。重複のないデータでは、[重複フラグ]列は空のままになります。この設定では、元データと重複データの両方を保持しながら、重複データを識別できます。重複データをすぐに削除せず、確認や検証、加工処理を行ったうえで、保持または破棄するデータを決定できます。

以下は画面の例です。



Notes
メモ:データセットのサンプルで重複が見つからない場合があります。その場合でも、エクスポート時にデータセット全体を処理する際、重複した行を削除するルールを適用できます。

3. 重複した行が赤色で強調表示されたリアルタイムプレビューが表示されます。



4. [重複を削除する]をクリックします。

列単位

1つまたは複数の列を選択して、重複を削除することもできます。重複を削除]→[列単位]の加工を使用すると、選択した列に含まれる重複した値に基づいて行を削除できます。

つまり、同じ値が縦方向に並んでいる列(例:地域、住所、商品)をすべて選択します。列単位で重複を削除すると、選択した列で縦方向に同じ値を持つ行が削除されます。

列単位で重複を削除するには

1. [加工]メニューをクリックし、[重複を削除]をクリックして、[列単位]を選択します。

2. 重複した行を削除する際、重複の識別方法を調整するために、次の設定を有効にできます。

大文字と小文字を区別しない] - 大文字と小文字を同じ文字として扱い、重複とみなします。

空白を無視する] - 単語の先頭や末尾の半角スペース、および単語間の連続する半角スペースを無視し、重複とみなします。

重複データのフラグを設定する] - 新しい列で重複データにフラグを設定します。後から、新しく追加された列を使用して重複データを除外できます。重複のないデータでは、[重複フラグ]列は空のままになります。この設定では、元データと重複データの両方を保持しながら、重複データを識別できます。重複データをすぐに削除せず、確認や検証、加工処理を行ったうえで、保持または破棄するデータを決定できます。

以下は画面の例です。



3. 選択した列に基づいてデータセットの重複を削除する方法として、[自動で重複を削除する]または[独自の条件を設定する]のいずれかを選択できます。

4. [自動で重複を削除する]メソッドを選択すると、選択した列に基づいてDataPrepがデータの重複を自動的に削除します。



5. [独自の条件を設定する]メソッドを選択した場合は、条件と式を入力し、条件文を作成する必要があります。条件が真の場合、重複グループごとに保持または削除する行を選択できます。
 

6. 次のテーブルは、すべてのデータの種類で使用できる条件の一覧です。データの種類について詳しくは、こちらをクリックしてください

テキスト

数値

日時

期間

真偽値

リスト

マップ

次の値を含む

= 次の値と等しい

= 次の値と等しい

最も小さい

次の値を持つ

キーあり

次の値を含まない

!= 次の値と等しくない

!= 次の値と等しくない

最も大きい

リストの内容が空である

マップの内容が空である

次の値から始まる

> 次の値より大きい

最も古い

= 次の値と等しい

次の値を含む

リストの内容が空ではない

マップの内容が空ではない

次の値で終わる

<次の値未満

最新である

!=次の値と等しくない

次の値を含まない

空である

空である

次の値と等しい

>=次の値以上

次の値より後

空である

次の値から始まる

空ではない

空ではない

次の値と等しくない

<=次の値以下

次の値より前

空ではない

次の値で終わる

正規表現を使用する

正規表現を使用する

空である

最も小さい

次の値以降

正規表現を使用する

次の値と等しい

パターンを使用する

パターンを使用する

空ではない

最も大きい

次の値以前

パターンを使用する

次の値と等しくない

 

 

正規表現を使用する

空である

空である

 

空である

 

 

パターンを使用する

空ではない

空ではない

 

空ではない

 

 

 

正規表現を使用している

正規表現を使用している

 

正規表現を使用している

 

 

 

パターンを使用している

パターンを使用している

 

パターンを使用している

 

 


7. AND演算子やOR演算子を使用して条件を追加し、複数の条件を組み合わせて重複を削除することもできます。

Idea
たとえば、「mail列が次の値を含む:zoho.com。該当する行を保持する」という条件を指定できます。つまり、保持する行を選択する条件を入力します:mail列が次の値を含む:zoho.com。該当する行を保持する

8. [詳細]設定では、関数を挿入し、重複を削除するための条件を指定できます。



9. 加工処理で削除される行を確認するには、[プレビュー]ボタンをクリックします。

10. [重複を削除する列]で(+)を使用すると、重複を削除する複数の列を選択することもできます。

よくある質問

1. [重複にフラグを付ける]設定を使用して行ごとの重複削除の加工を適用するたびに、重複数が減るのはなぜですか?

フラグ設定を使用して重複削除の加工を適用するたびに、重複レコードを示す新しい列が追加されます。再度適用すると、このフラグ列も重複チェックの対象になります。フラグが付いたすべてのレコードには同じフラグ値が設定されているため、1つのグループにまとめられます。そのため、適用するたびに重複数が減少します。

例。
1回目 → 5件のレコード → 重複4件、マスター1件
2回目 → 重複3件、マスター1件
3回目 → 重複2件、マスター1件

これを避けるには、加工を再度適用する前に、重複レコードをフィルターで抽出して削除してください。

関連情報