データセット変換

データセット変換

お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の英語版を参照してください。

データセットの加工では、用途に応じてデータセットを結合、加工できます。データセットには、次の加工処理を適用できます。
  • 重複を削除
    • 行単位
    • 列単位
  • 結合する
  • 追加する
  • ピボット
  • 列から行に変換
  • 計算した列
  • 派生データセットを作成
  • 個人情報として設定
データセットの加工はすべて、上部バーの[加工]メニューにあります



重複を削除

[重複を削除]の加工処理を使用すると、データから重複するデータを削除できます。重複は、行単位または列単位の2通りの方法で削除できます。

行単位

このメソッドでは、重複するデータを含む行が削除され、重複のない行だけがデータセットに残ります。

行単位の重複を削除するには。

1. [加工]メニューをクリックし、[重複を削除]をクリックして、[行単位]を選択します。

2. 重複する行を削除する際に、大文字と小文字を区別せず、空白文字を無視するように設定できます。

メモ:データセットのサンプルで重複が見つからない場合もあります。その場合でもルールを適用すると、エクスポート時にデータセット全体が処理される際、重複する行を削除できます。

3. 重複する行が赤色で強調表示されたリアルタイムのプレビューが表示されます。



4. [重複を削除する]をクリックします。

列単位

1つまたは複数の列を選択して、重複を削除することもできます。この加工処理では、選択した列に含まれる重複した値に基づいて行が削除されます。

列単位の重複を削除するには。

1. [加工]メニューをクリックし、[重複を削除]をクリックして、[列単位]を選択します。

2. 重複を検出する際に、大文字と小文字を区別せず、空白文字を無視するように設定できます。

3. 選択した列に基づいてデータセットの重複を削除するには、[自動で重複を削除する]または[独自の条件を設定する]のいずれかのメソッドを選択できます。

4. [自動で重複を削除する]メソッドを選択すると、選択した列に基づいてDataPrepが自動的にデータの重複を削除します。



5. [独自の条件を設定する]メソッドを選択した場合、条件と式を入力し、「if」文を作成する必要があります。条件が真の場合、重複する各グループ内で保持または削除する行を選択できます。

 

6. 次のテーブルは、すべてのデータの種類で使用できる条件を示しています。データの種類について詳しくは、こちらをクリックしてください

テキスト

数値

日時

期間

真偽値

リスト

マップ

次の値を含む

=次の値と等しい

=次の値と等しい

最も小さい

次の値を持つ

キーあり

次の値を含まない

!=次の値と等しくない

!=次の値と等しくない

最も大きい

リストの内容が空である

マップの内容が空である

次の値から始まる

>次の値より大きい

最も早い

=次の値と等しい

次の値を含む

リストの内容が空ではない

マップの内容が空ではない

次の値で終わる

<未満

最新である

!=次の値と等しくない

次の値を含まない

セルが空である

セルが空である

次の値と等しい

>=以上

次の後

セルが空である

次の値から始まる

セルが空ではない

セルが空ではない

次の値と等しくない

<=以下

次の前

セルが空ではない

次の値で終わる

正規表現を使用している

正規表現を使用している

セルが空である

最も小さい

次の値以降

正規表現を使用している

次の値と等しい

パターンを使用している

パターンを使用している

セルが空ではない

最も大きい

次の値以前

パターンを使用している

次の値と等しくない

 

 

正規表現を使用している

セルが空である

セルが空である

 

セルが空である

 

 

パターンを使用している

セルが空ではない

セルが空ではない

 

セルが空ではない

 

 

 

正規表現を使用している

正規表現を使用している

 

正規表現を使用している

 

 

 

パターンを使用している

パターンを使用している

 

パターンを使用している

 

 


7. AND演算子とOR演算子を使用して条件を追加し、複数の条件を組み合わせて重複を削除することもできます。
たとえば、「mail列zoho.com が含まれている場合、それらの行を保持する」という条件を次のように指定できます。
選択対象を指定する条件を入力
mailにzoho.comが含まれている場合

8. [詳細]設定では、関数を挿入し、重複を削除するための条件を指定できます。



9. 加工時に削除される行を確認するには、[プレビュー]ボタンをクリックします。

10. [重複削除の対象列]で[+]を使用すると、重複削除の対象として複数の列を選択することもできます。

結合

結合加工を使用すると、共通の列に基づいて2つのデータセットを結合できます。結合加工の簡単な動画を確認するには、こちらをクリックしてください。

たとえば、店舗の購入データを含むデータセットと、その顧客情報を含む別のデータセットがあるとします。顧客IDなどの共通の列を使用して両方のデータセットのレコードを識別し、一致させることで、これらのデータセットを結合できます。

DataPrepでは、内部結合、左結合、右結合、外部結合という、4種類すべての結合を利用できます。

結合加工を実行するには。

1. [加工]メニューをクリックし、[結合]をクリックして、[結合する]を選択します。

Info情報:パイプラインの作成画面でアイコンをクリックするか、ステージを右クリックして、[結合する]加工を選択することもできます。



2. データセットの結合ダイアログで、現在のデータセットと結合するデータセットと、結合の種類を選択できます。  

3. [結合するデータセットを選択]ドロップダウンで、現在のデータセットと結合するデータセットを選択します。

結合加工の結果を含む新しいデータセットが作成されます。


 
DataPrepでは、現在のデータセットとワークスペース内のその他のデータセットとの結合の一致率が自動的に計算され、表示されます。結合の一致率はパーセント(%)で表示されるため、結合加工に使用するデータセットを簡単に選択できます。この値は、列内で一致するデータの量や、データセット間で一致する列名など、さまざまな要素に基づいて計算されます。

4. 結合の種類を選択するには、[結合の種類]オプションを使用します。加工パネルの[結合の種類]メニューから結合の種類を変更することもできます。

 

5. 加工パネルの[新しいデータセット名]欄に、新しいデータセットの名前を入力します。

6. 2つのデータセットの結合に使用する列を、次の一致する列セクションで選択します。

重複する列名の解決

 
7. [プレビュー]ボタンをクリックします。同じ名前の列がある場合、重複する列名の解決ダイアログが表示されます。重複する列を解消するには、名前を変更するか削除する必要があります。

8. 結果のデータセットに含めない列は、プレビューの列見出しにあるチェックボックスを使用して選択を解除できます。    

9. 2つのデータセットを結合するには、[結合する]をクリックします。



10. 2つのデータセットの結合が完了したら、[開く]をクリックして、結合したデータセットを開くことができます。



11. 結合の設定を表示するには、結合したデータセットのルールセットパネルから[データソースの設定]を開きます。



12. [結合を編集する]をクリックして、結合の設定を更新することもできます。



通常、結合は、共通する項目に基づいて2つの異なるデータセットを結合するために使用します。それぞれの結合の種類を例とともに確認してみましょう。

内部結合

内部結合では、共通の列を使用して2つのデータセットを結合し、一致しないすべての行を破棄します。

内部結合は次のように表されます。



次のデータセットを例に説明します。

注文データセット



顧客データセット



ここでは、注文IDが共通の列です。内部結合では、注文ID列の値が共通する2つのデータセットの行が結合され、注文データセットと顧客データセットの両方から一致しない値が除外されます。



左結合


左結合では、共通の列を使用して現在のデータセットと別のデータセットを結合し、別のデータセットから一致しない行をすべて除外します。

左結合は次のように表されます。



次のデータセットを例に説明します。

注文データセット



顧客データセット



左結合では、注文ID列の値が共通する2つのデータセットの行が結合されます。一致しない値は、顧客データセットからのみ除外されます。



右結合


右結合では、共通の列を使用して現在のデータセットと別のデータセットを結合し、現在のデータセットから一致しない行をすべて除外します。
右結合は次のように表されます。



次のデータセットを例に説明します。

注文データセット



顧客データセット



右結合では、注文ID列の値が共通する2つのデータセットの行が結合されます。一致しない値は、注文データセットからのみ除外されます。


外部結合

外部結合では、共通の列を使用して2つのデータセットを結合し、一致しない行を含む両方のデータセットのすべての行を保持します。外部結合は次のように表されます。



次のデータセットを例に説明します。

注文データセット



顧客データセット



外部結合では、注文ID列の値が共通する2つのデータセットの行が結合されます。注文データセットと顧客データセットの両方で、一致しない値も保持されます。


追加

DataPrepでは、「追加する」加工を使用して、あるデータセットに別のデータセットを追加し、新しいデータセットを作成できます。「追加する」加工の簡単な動画を見るには、こちらをクリックしてください

データセットを追加するには

1. [加工]メニューをクリックし、[結合]をクリックして、[追加する]を選択します。

情報:パイプラインの作成画面でアイコンをクリックするか、ステージを右クリックして、[追加する]加工を選択することもできます。



2. [データセットを追加]ダイアログで、現在のデータセットに追加するデータセットを選択できます。

「追加する」加工の結果を含む新しいデータセットが作成されます。



3. 加工パネルの[新しいデータセット名]欄に、新しいデータセットの名前を入力します。

4. DataPrepによって2つのデータセットの列名が比較され、一致しない列が表示されます。これらの列を含めるか除外するかを選択できます。一致する列の場合、追加するデータは一致した列のすぐ下に追加されます。



5. [プレビュー]ボタンをクリックすると、DataPrepに「追加する」加工のリアルタイムのプレビューが表示されます。



6. 加工を適用するには、[追加する]をクリックします。行を追加して2つのデータセットを正常に結合したら、[開く]をクリックして、結合したデータセットを開きます。



7. 「追加する」加工の設定を編集するには、新しく作成したデータセットの[ルールセット]のパネルから[データソースの設定]を開き、設定を編集します。


ピボット

ピボットテーブルでは、データを見やすく配置できます。カテゴリーを列に変換することで、縦に長いテーブルのデータを展開します。[列][行][データ]の各項目を選択して、ピボットを作成できます。ピボット加工の簡単な動画を見るには、こちらをクリックしてください。

ピボット加工を適用するには

1. [加工]メニューをクリックし、[ピボット]を選択します。[ピボット]のパネルがスライドして開きます。

情報:パイプラインの作成画面でアイコンをクリックするか、ステージを右クリックして、[ピボット]加工を選択することもできます。




2. 列に変換する項目を[列]セクションで選択します。行として表示する項目を[行]セクションで選択し、データを含む項目を[データ]セクションで選択します。機能については、こちらをクリックしてください。



メモ:データセクションでは、数値データを含む項目のみ選択できます。

3. フィルターを適用する場合は、[フィルター]タブを選択することもできます。フィルターを使用すると、1つ以上の列に適用したフィルター条件に基づいて、データを選択的に絞り込むことができます。フィルターの詳細については、こちらをクリックしてください。



4. 列と行の順序を変更する場合は、[並べ替え]タブを選択します。[ピボット]タブで追加した項目は、[並べ替え]タブにも表示されます。[行ごと]セクションと[列ごと]セクションを使用して、データを行ごとまたは列ごとに並べ替えることができます。

[列ごと]セクションと[行ごと]セクションで設定を選択すると、データを昇順、降順、または独自の順序で並べ替えることができます。

[プレビュー]ボタンをクリックすると、テーブルのプレビューを表示できます。標準の選択(昇順)に戻すには、[リセットする]をクリックします。

たとえば、[列ごと]セクションの「商品カテゴリー」項目で[昇順]、「地域」項目で[降順]の設定を選択し、[行ごと]セクションの「顧客名」フィルターで[昇順]の設定を選択すると、営業データを並べ替えることができます。並べ替えたデータは、以下のプレビューのように表示されます。



[独自]設定を選択して、並び順をカスタマイズすることもできます。ドラッグ&ドロップするか、上矢印と下矢印を使用して、行と列を並べ替えることができます。



メモ:フィルター機能と並べ替え機能の使用は任意です。

5. [データ]セクションに項目を追加し、いずれかの集計関数を選択できます。追加した項目のデータの種類に応じて、合計、件数、平均値などを算出できます。データの種類ごとに使用できる関数のリストを次のテーブルに示します。

データの種類

関数

数値

合計

最大

最小値

平均値

標準偏差

中央値

最頻値

パーセンタイル

分散

件数

重複しない値の件数

テキスト

件数

重複しない値の件数

日付

件数

重複しない値の件数

最大日付

最小日付

リスト

件数

重複しない値の件数

マップ

件数

重複しない値の件数


Notes メモ: リストのデータの種類に使用する関数では値の件数を数え、 マップのデータの種類に使用する関数ではキーの件数を数えます。

6.   [プレビュー] ボタンをクリックすると、DataPrepにピボット変換のリアルタイムのプレビューが表示されます。



7. [列]ボックスで2つ以上の項目を選択すると、列名がダッシュまたはハイフン(-)で連結されます。

8. 新しいデータセットでは、[ルールセット]のパネルからデータソースの設定を開き、ピボット設定を編集できます。

9. データセットにピボット設定を適用するには、[ピボット]をクリックします。

列から行に変換

列から行に変換すると、列が行に変換されます。この加工はデータを集約する場合に便利で、加工したデータはレポートやダッシュボードを作成するために分析ソフトウェアへエクスポートされることがよくあります。加工を適用すると、結果が新しいデータセットとして保存されます。

列から行に変換する加工を適用するには

1. [加工]メニューをクリックし、[列から行に変換]を選択します。

情報:パイプラインの作成画面でアイコンをクリックするか、ステージを右クリックし、[列から行に変換]の加工を選択することもできます。



2. [新しいデータセット名]項目に、新しいデータセットの名前を入力します。

3. [適用する列]欄で、列から行に変換する列を選択します。ここで選択した列が行に変換されます。

4. 選択した列の列見出しを使用して、新しい列が作成されます。[ヘッダーの列名]項目に、この新しい列の名前を入力します。



5. 選択した列の値は、別の列に追加されます。[値の列名]項目に、この列の名前を入力します。

6. [プレビュー]ボタンをクリックすると、DataPrepに加工を有効にした場合のプレビューが表示されます。

 

7. [適用]をクリックし、列から行に変換する加工を適用します。

数式列

数式列の加工を使用すると、新しい列を作成してカスタマイズできます。Zoho DataPrepでは、用途に応じたさまざまな関数を利用できます。関数の詳細については、こちらをご覧ください。

数式列を作成するには

1. [加工]メニューをクリックし、[数式]列を選択します。

2. [新しい列名]項目に、新しい列の名前を入力します。

3. [数式]項目に関数名を入力するか、IntelliSenseを使用して関数を補完します。[クリックして関数を挿入]セクションでは、フィルターを適用して関数を検索することもできます。

4. [OpenAI ChatGPT]タイルをクリックし、ChatGPTにプロンプトを送信して数式を生成することもできます。詳しくはこちらをご覧ください。

5. 数式にパラメーターを追加したり、IntelliSenseを使用して列を選択したりできます。[クリックして列を挿入]セクションで列名を検索することもできます。




6. [プレビュー]ボタンをクリックすると、数式への変更を有効にした場合のプレビューがDataPrepに表示されます。

7. [適用]をクリックして、変更を適用します。

派生データセットの作成

派生データセットを作成する加工では、データセットに最後に適用済みの加工から分岐するデータセットを作成できます。新しいデータセットには、最新のデータと空のルールセットが含まれます。

派生データセットを作成するには

1. [加工]メニューをクリックし、[派生データセットを作成]を選択します。

2. [新しいデータセット名]項目に、派生データセットの名前を入力します。
 

3. [適用]をクリックして、派生データセットを作成します。

これで、派生データセットが正常に作成されました。新しく作成されたデータセットには、最新のデータと空のルールセットが含まれます。

4. [開く]をクリックして、新しいデータセットの使用を開始できます。

5. 派生データセットの[データソースの設定]をクリックすると、親データセットの元データの詳細を確認できます。



個人情報として設定

個人情報または電子的保護対象医療情報(ePHI)を含む列は、[個人情報と電子的保護対象医療情報(ePHI)に設定する]加工を使用して設定できます。また、列にセキュリティ設定を適用してデータを保護し、エクスポート時にこれらの列を含めるか除外するかを選択できます。

 

個人情報を含む列を設定するには      

1. [加工] メニューをクリックし、[個人情報と電子的保護対象医療情報(ePHI)に設定する] を選択します。

Info また、 列を右クリックし、操作メニューから[個人情報と電子的保護対象医療情報(ePHI)に設定する] を選択することもできます。

 

2. 個人情報を含む 列を 個人情報として設定する列 セクションに追加します。

 

3. [適用]をクリックして、 選択した 列を個人情報として設定します。





電子的保護対象医療情報(ePHI)を含む列を設定するには

1. [加工]メニューをクリックし、[個人情報と電子的保護対象医療情報(ePHI)に設定する]を選択します。

情報:列を右クリックし、操作メニューから[個人情報と電子的保護対象医療情報(ePHI)に設定する]を選択することもできます。

2. 医療情報を含む列を電子的保護対象医療情報(ePHI)を含む列を設定するセクションに追加します。



3. [適用]をクリックして、選択した列を電子的保護対象医療情報(ePHI)を含む列として設定します。

エクスポート時に個人情報または電子的保護対象医療情報(ePHI)を保護するには  

 

1.  パイプラインの作成画面 でデータフローの作成と、各ステージへの必要な 加工処理 の適用が完了したら、ステージを右クリックし、 [エクスポート先を追加する] を選択します。



 

 

2. サイドパネルで、データをエクスポートするエクスポート先を 選択できます。例として、 [ファイル] をエクスポート先として選択します。

3. エクスポートに含める個人情報または電子的保護対象医療情報(ePHI)を含む列を、 対応するチェックボックスで選択します。

Notes メモ :個人情報または電子的保護対象医療情報(ePHI)として設定されていない列は、標準で含まれます。
 


4. 個人情報を保護するために必要なセキュリティ設定をドロップダウンから選択し、 [次へ] をクリックします。

個人情報または電子的保護対象医療情報(ePHI)を含む 列には、3種類のセキュリティ対策を 適用できます。これらのセキュリティ対策は、個人情報などの機密データを保護するために使用されます。

個人情報または電子的保護対象医療情報(ePHI)を保護するためのセキュリティ対策

1. [データマスキング]
データマスキングでは、元のデータを「x」で隠して個人情報を保護します。
 
2. [データのトークン化]
データのトークン化では、データ内の異なる値をそれぞれランダムな値に置き換えます。そのため、出力内容は元のデータと統計的に同一になります。
 
3. [なし]
セキュリティ設定を使用しない場合は、[なし]を選択できます。

Notes メモ
1.
個人情報を保護せずにデータセットをエクスポートすることが制限されるのは、[データのエクスポート時に個人データの保護を必須にする]オプション組織のプライバシー設定で有効になっている場合です。詳細はこちらをご確認ください。
2. 組織のコンプライアンス設定に基づき、電子的保護対象医療情報(ePHI)を含むデータセットのエクスポートが制限されることがあります。また、セキュリティ対策やパスワード保護によって電子的保護対象医療情報(ePHI)を保護せずにデータセットをエクスポートすることが制限される場合もあります。詳細はこちら
5. 必要な値を入力し、その後、エクスポート]をクリックします。



メモ:自分のすべてのワークスペースにおける個人情報や電子的保護対象医療情報(ePHI)の保護状況は、[すべてのワークスペースの個人情報を確認]セクションでも確認できます。詳細はこちらをご確認ください。

関連情報