Zoho DataPrep Studio

Zoho DataPrep Studio

お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の英語版を参照してください。




データ準備について、 Studioページの概要を以下のセクションで説明します。
  • データ分布
  • データの品質
  • 候補の自動提案
  • 検索とフィルター
  • 上部バー


上の画像には、Studioページとそれに関連するすべてのセクションが表示されています。

データ分布

DataPrepでは、ヒストグラムを使用して、データ分布と列に含まれる値の範囲を視覚的に確認できます。これにより、データ内の異常値や異常を特定できます。ヒストグラムの棒またはセクションを選択すると、その範囲内のデータが抽出されます。



このヒストグラムの詳細版は、列を選択すると下部に表示される[列の詳細情報]にもあります。



ヒストグラム内の値を編集すると、列全体に変更を反映できます。また、 アイコンを使用して値を並べ替えることもできます。

検索アイコンをクリックし、以下のいずれかの条件を使用してヒストグラム内の値を検索することもできます。
  1. [次の値を含む]
  2. [次の値を含まない]
  3. [次の値と等しい]
  4. [次の値と等しくない]
  5. [次の値から始まる]
  6. [次の値から始まらない]
  7. [次の値で終わる]
  8. [次の値で終わらない]

データの品質

DataPrepには、データの品質を測定し、改善するためのさまざまな設定があります。データ準備ページの以下の領域で、データの品質を評価できます。
  • データの品質分布
  • 列の詳細情報セクション
  • ステージの詳細セクション

データの品質分布

データの品質分布は、各列のデータの品質を表します。列のデータの種類に基づき、データの品質が有効なデータ、無効なデータ、欠損値に分類されます。緑色は有効なデータ、赤色は無効なデータ、灰色は欠損値を表します。

セクションをクリックすると、DataPrepによって該当する行が抽出されるため、データ内の無効な値や欠損値を簡単に処理できます。
  1. 列のデータの品質をすばやく確認するには、データの品質分布にカーソルを合わせます。

  1. 各列のデータの品質を表示するには、[すべての列を表示する]をクリックします。

列の詳細情報セクション

列の詳細情報セクションには、各列のデータの概要として、データの種類、列内の重複のない値の数、欠損値、無効な値、有効な値の各件数が表示されます。
Notes
メモ:データの種類の候補を提示するため、ステージの先頭100行が処理されます。
  1. 列を選択すると、下部パネルに列の詳細情報が表示されます。

  1. このセクションには、各列の上部にあるヒストグラムの詳細版が表示されます。ヒストグラム内の値を編集すると、列全体に変更を反映できます。また、アイコンを使用して値を並べ替えることもできます。

  2. 検索アイコンをクリックし、以下のいずれかの条件を使用してヒストグラム内の値を検索することもできます。
    1. [次の値を含む]
    2. [次の値を含まない]
    3. [次の値と等しい]
    4. [次の値と等しくない]
    5. [次の値から始まる]
    6. [次の値から始まらない]
    7. [次の値で終わる]
    8. [次の値で終わらない]

       
  1. 選択した列の詳細を展開して表示するには、[詳細をさらに表示]リンクをクリックします。このセクションには、統計、異常値、重複のない値、データのパターンなど、列に関するさまざまな情報が表示されます。

異常値と異常の検出

  1. Zoho DataPrepでは、機械学習技術を使用してデータ内の異常を特定します。これにより、ユーザーはデータのパイプライン内の異常に対処できます。データ内の異常を保持するか削除するかを選択できます。DataPrepの異常値検出機能については、次のGIFで簡単に確認できます。



  2. 列名の横にある操作メニューの設定から、[詳細をさらに表示]ページに表示するウィジェットを選択することもできます。


ステージの詳細セクション

ステージの詳細では、ステージ全体のデータの品質がドーナツグラフで表示されます。この数値は、各列の品質を総合して算出されます。このセクションは、ステージがデータ準備画面に初めて読み込まれたとき、および列が1つも選択されていないときに表示されます。

ステージの詳細には、以下の情報が表示されます。
  • サンプル行
  • サンプルの作成方法(ランダム、エラー、列単位、初期データのサンプルを含む)
  • 行の合計
  • 列数
  • データ内のデータの種類の数
  • ステージ全体のデータの品質を表すドーナツグラフ
ドーナツグラフでは、データが有効なデータ、無効なデータ、欠損値のパーセント(%)に分類されます。データ内の有効な値、無効な値、欠損値を個別に表示するには、ドーナツグラフの各セクションをクリックします。


サンプルの作成方法

サンプルの生成は、加工処理を高速化するために不可欠です。さまざまな方法を使用して、データ全体からサンプルを抽出します。データを初めてインポートしたときは、初期データのサンプルが使用されます。データ準備処理中は、いつでも作成方法を変更できます。サンプルの作成方法を変更するには、ステージの詳細パネルの編集アイコンをクリックします。



使用できるサンプルの作成方法は以下のとおりです。
  • 初期データのサンプル:インポートしたファイルの先頭5MBのデータから生成されます。
  • ランダムのサンプル:インポートしたファイルから行がランダムに選択されます。
  • エラーのサンプル:無効な値または欠損値を含む行です。
  • 列単位のサンプル:選択した列の重複しない値に基づいて生成されます。
Notes
メモ:生成されたサンプルはsamplestateとして保存されます。これは、画面上で表示および操作するデータ範囲を表します。このsamplestateは、データをエクスポートする際にも含まれます。

候補の自動提案

DataPrepでは、インポートしたデータに基づいて加工処理が提案され、効率的にデータを準備できます。候補は、1つまたは複数の列を選択したときや、フィルターを適用したときに表示されます。
  1. 提案された加工処理のいずれかをクリックすると、データに適用される加工処理のライブプレビューが表示された状態で、Studioパネルに移動します。
  1. 提案された処理を適用する前に、操作バーで設定や条件を編集できます。
      

検索とフィルター

 ボックスを使用して、検索やデータの抽出を行います。[検索とフィルター]ボックスでは、ルールとして適用せずにデータを抽出して確認できます。ただし、抽出された行を保持または削除することで、ルールとして適用することもできます。

[検索とフィルター]ボックスのフィルターアイコンから、以下の標準のフィルター設定を選択することもできます。
  1. [有効な値を含む行を抽出する] - 有効なデータを含む行のみが表示されます 
  2. [無効な値を含む行を抽出する] - 無効なデータを含む行のみが表示されます
  3. [欠損値を含む行を抽出する] - 欠損データを含む行のみが表示されます
  4. [欠損値または無効な値を含む行を抽出する] - 欠損データまたは無効なデータを含む行のみが表示されます。


独自のフィルター条件に基づいてデータを抽出する場合は、データの抽出後に表示される[詳細設定]を使用できます。



データを検索するには

  1. データを検索するには、[検索とフィルター]ボックスに値を入力します。検索キーワードは、標準の条件「[次の値を含む]」に基づいて、ボックスの下にチップとして追加されます。
  2. チップを選択すると、検索キーワードと条件をいつでも編集できます。


  1. 検索結果が表示されたら、フィルターされた行を[保持する]か[削除する]かを選択できます。選択に応じて、フィルターされた行を含む、または除外した結果データが表示されます。
Notes
詳細フィルターパネルを開くと、すべての検索キーワードが自動的に反映されます。


データにフィルターを適用するには

  1. 別の方法でステージにフィルターを適用するには、ヒストグラム、データの品質分布、またはドーナツグラフをクリックします。



  2. フィルターを適用すると、[検索とフィルター]ボックスの下にチップが表示されます。チップを選択すると、検索キーワードと関連付けられた条件をいつでも編集できます。
  3. 複数のフィルターを適用でき、フィルターごとにチップが追加されます。
Notes
1. 詳細フィルターパネルを開くと、設定済みのすべてのフィルターが自動的に反映されます。
2. パネルを開いている間に追加したフィルターも反映されます。
3. 詳細フィルターパネルでフィルターを編集することもできます。
次のセクションでは、詳細フィルターについて説明します
  1. フィルターでは、次の条件を使用できます。
    1. [次の値を含む(標準)]
    2. [次の値を含まない]
    3. [次の値で始まる]
    4. [次の値で始まらない]
    5. [次の値で終わる]
    6. [次の値で終わらない]
    7. [次の値と等しい]
    8. [次の値と等しくない]
    9. [正規表現に一致する]
  1. フィルターの適用後、チップの横に表示される[行を保持する]または[行を削除する]ルールを選択して適用できます。
  2. 編集]リンクを使用して、追加したフィルターを編集することもできます。
  3. 特定のフィルターを削除するには、チップにカーソルを合わせたときに表示される閉じるアイコンをクリックします。
  4. すべてのフィルターを一括で削除するには、[クリアする]リンクをクリックします。

詳細フィルター

詳細フィルターでは、1つ以上の列に適用した独自の条件に基づいてデータにフィルターを適用できます。詳細フィルターはデータの確認を目的とした機能であり、ルールとして適用せずにデータを絞り込めます。ただし、フィルターされた行を保持または削除することで、ルールとして適用することもできます。データにフィルターを適用すると、[高度な条件を適用する]リンクが表示されます。データへのフィルターの適用については、こちらをクリックしてください

Notes
1. 詳細フィルターパネルを開くと、設定済みのすべてのフィルターが自動的に反映されます。
2. パネルを開いている間に追加したフィルターも反映されます。
3. 詳細フィルターパネルでフィルターを編集することもできます。

詳細フィルターを適用するには

1. ドーナツグラフ、ヒストグラム、または標準のフィルター設定をクリックして、データにフィルターを適用します。列を右クリックして選択することもできます。データへのフィルターの適用については、こちらをクリックしてください

2. データグリッドの上に[高度な条件を適用する]リンクが表示されます。 高度な条件を適用する]リンク クリックすると、パネルがスライドして開きます。
     


2. フィルターに列を追加するには、アイコンをクリックします。ドラッグ&ドロップでフィルターの順序を変更することもできます。

3. [フィルター]セクションに複数のフィルターを追加すると、論理演算子のANDまたはORがフィルターの横に表示されます。クリックすると、論理演算子をANDとORで切り替えられます。



4. 論理演算子を使用して条件を結合し、優先順位を決めるロジックを設定できます。最終的な式は、[条件式]ボックスに表示されます。[編集]をクリックすると、論理演算子と括弧を使用して標準の式を変更し、優先順位や条件を評価する順序を指定できます。必要な変更を行った後、[保存する]をクリックします。

たとえば、式「((1 OR 2) AND (3 OR 4))」では、最初に条件「(1 OR 2)」が実行され、次に条件「(3 OR 4)」が実行されます。最後にAND演算子が使用されているため、両方の条件が真の場合にフィルターが適用されます。

5. すべてのフィルターを削除するには、[クリアする]ボタンを使用します。

6. 追加した各フィルターでは、ドロップダウンから次のいずれかの設定を選択できます。
  1. 実値]:列内の実際の値に基づいて行にフィルターを適用できます。
  2. データの品質]:列内のデータの品質に基づいて行にフィルターを適用できます。
  3. パターン]:選択した列のデータパターンに基づいて行にフィルターを適用できます。
  4. 周期]:四半期、月、週などの周期パラメーターに基づいて行にフィルターを適用できます。
  5. 異常値]:選択した列のデータに含まれる異常値に基づいて行にフィルターを適用できます。
Notes
フィルター設定は、フィルターに追加した列のデータ型に基づいて表示されます。フィルター設定の詳細については、こちらをクリックしてください。

7. [フィルター]ボタンをクリックします。追加したフィルターの数は、データグリッドの上に表示されるチップに表示されます。  

8. 詳細フィルターでは、ルールを適用せずにデータにフィルターを適用できます。フィルター結果に問題がなければ、行を保持するまたは行を削除するルールを選択して適用できます。


上部バー

それぞれをクリックすると、ワークスペースの詳細ページまたはパイプラインビルダーページに移動できます。上部バーからエクスポート先を追加したり、項目を検索したりできます。