異常検知

異常検知

お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の英語版を参照してください。



異常検出とは

異常検出は異常値検出とも呼ばれ、データセット内で想定されるパターンや挙動から大きく外れたレコードやデータポイントを特定する処理です。異常を検出することで、データの品質に関する潜在的な問題、通常とは異なるビジネス傾向、運用上のリスク、パフォーマンスの予期しない急上昇や急低下を特定できます。

Zoho DataPrepでは、IQR(四分位範囲)、Zスコア、パーセンタイルベースのメソッドなどの統計的手法を使用して、データ内の通常とは異なる値を検出できます。これらのメソッドは、データセットの特性や分布に応じて適用でき、後続の処理や分析を行う前に、データをより効果的にクリーンアップ、監視、分析するのに役立ちます。

異常検出を適用するには

1. 列を右クリックし、操作メニューから[異常検出]を選択します。



Notes
メモ:異常検出の加工では、テキスト、リスト、マップ、真偽値、URL、メールアドレスを除く、すべてのデータの種類がサポートされています。

2. 異常値の検出に使用するモデルを選択します。使用可能なモデルは、統計モデル(IQR、Zスコア、パーセンタイル)と独自の範囲の2つのカテゴリーに分類されます。



統計モデル
     
       IQR - 四分位範囲(IQR)は、データセットの中央50%が含まれる範囲を示す統計的なばらつきの指標です。この範囲に基づいて異常値が算出されます。詳細はこちら

      Zスコア- Zスコアは、データポイントがデータセットの平均値から標準偏差何個分離れているかを示します。標準では、Zスコアが標準偏差の3倍を超えるデータポイントが異常値として識別されます。詳細はこちら

      パーセンタイル- パーセンタイルは、データセット内の特定の値の相対的な位置を表す統計指標です。パーセンタイルではデータが100等分され、各パーセンタイルの値は、指定した値以下の値が占めるパーセント(%)を示します。異常値はパーセンタイル値に基づいて判定されます。詳細はこちら

独自の範囲 

このメソッドでは、データ内の任意の値を上限値と下限値に指定します。しきい値に基づいて異常値が算出されます。詳細はこちら

Info
情報:範囲の項目でサポートされる数値の最大精度は38、最大小数点以下桁数は15です。この上限を超える値は、自動的に空の値(null)に設定されます。

3. 必須の詳細を入力し、[適用]をクリックして異常値を検出します。

IQRモデルを選択した場合

IQRとは

四分位範囲(IQR)は、データセットの中央50%が含まれる範囲を示す統計的なばらつきの指標です。この範囲に基づいて異常値が算出されます。

IQRは、第3四分位数(Q3)と第1四分位数(Q1)の差として算出されます。標準のスケール値1.5をIQRに掛けて、上限と下限(しきい値)を決定します。しきい値は、データの分布に応じて調整できます。

分布に偏りがあるデータには、調整済みIQRメソッドが適用されます。

1. [しきい値]で、下限と上限の値を入力します。しきい値は、値を異常値と見なす境界を定義します。スケール値をIQRに掛けて、これらの境界を決定します。

メモ:入力可能な範囲は0~2です。



2. 偏りのあるデータに調整済みIQRメソッドを自動的に適用するには、[データに偏りがある場合、調整済みIQRメソッドを適用する]チェックボックスを選択します。このチェックボックスは標準で選択されています。偏りに関係なく標準IQRメソッドを適用する場合は、選択を解除します。

3. 異常のあるレコードに新しい列でフラグを付ける場合は、[異常をフラグ付け]チェックボックスを選択します。異常のあるレコードでは、[異常フラグ]列にフラグが表示されます。異常のないレコードでは、この列は空のままになります。この列を使用すると、実行する処理を決定する前に、異常なレコードを確認またはフィルターできます。

4. [適用]をクリックします。

Zスコアモデルを選択した場合

Zスコアモデルとは

Zスコアは、データポイントがデータセットの平均値から標準偏差何個分離れているかを示します。標準では、Zスコアが標準偏差の3倍を超えるデータポイントが異常値として識別されます。

異常値を検出するしきい値には、多くの場合、Zスコア±3が設定されます。これは、平均値から左右いずれかの方向に標準偏差の3倍を超えて離れたデータポイントを異常値と見なすことを意味します。しきい値は、データの分布に応じて調整できます。

分布に偏りがあるデータには、修正Zスコアメソッドが適用されます。Zスコアは、中央絶対偏差メソッドに基づいて算出されます。

1. [標準偏差の数]で、下限と上限を入力します。標準値は-3と+3です。これらの範囲を超えるデータポイントは、異常値として識別されます。



2. 偏りのあるデータに修正Zスコアメソッドを自動的に適用するには、[データに偏りがある場合、修正Zスコアメソッドを適用する]チェックボックスを選択します。修正Zスコアは、中央絶対偏差(MAD)に定数値0.675を掛けて算出されます。偏りを考慮しない場合は、このオプションの選択を解除します。

3. 異常のあるレコードに新しい列でフラグを付ける場合は、[異常をフラグ付け]チェックボックスを選択します。異常のあるレコードでは、[異常フラグ]列にフラグが表示されます。異常のないレコードでは、この列は空のままになります。この列を使用すると、実行する処理を決定する前に、異常なレコードを確認またはフィルターできます。

4. [適用]をクリックします。

パーセンタイルモデルを選択した場合

パーセンタイルモデルとは

パーセンタイルは、データセット内の特定の値の相対的な位置を表す統計指標です。パーセンタイルではデータが100等分され、各パーセンタイルの値は、指定した値以下の値が占めるパーセント(%)を示します。異常値はパーセンタイル値に基づいて判定されます。

下限と上限の標準値には、それぞれ10パーセンタイルと90パーセンタイルが設定されています。

1. パーセンタイルの下限と上限を入力します。下限を下回る値と上限を上回る値は、異常値として扱われます。たとえば、下限を10に設定すると10パーセンタイルを下回る値にフラグが付き、上限を90に設定すると90パーセンタイルを上回る値にフラグが付きます。

メモ:入力可能な値の範囲は1~99です。パーセンタイルには小数値を指定できません。



2. 異常のあるレコードに新しい列でフラグを付ける場合は、[異常をフラグ付け]チェックボックスを選択します。異常のあるレコードでは、[異常フラグ]列にフラグが表示されます。異常のないレコードでは、この列は空のままになります。この列を使用すると、実行する処理を決定する前に、異常なレコードを確認またはフィルターできます。

3. [適用]をクリックします

独自の範囲オプションを選択した場合

このメソッドでは、データ内の任意の値を上限値と下限値に指定します。しきい値に基づいて異常値が算出されます。

Info
情報:範囲の項目でサポートされる数値の最大精度は38、最大小数点以下桁数は15です。この上限を超える値は、自動的に空の値(null)に設定されます。

1. 独自の範囲の下限値と上限値を入力します。

メモ:下限と上限には絶対値を入力し、下限に指定する値が上限に指定する値より小さくなるようにしてください。

Info
情報:日付の列では、ルールに表示される下限値と上限値が、入力した日付形式ではなくUnixタイムスタンプ値で表示されます。



2. 必須の入力内容を指定し、[適用]をクリックします。

3. 異常のあるレコードに新しい列でフラグを付ける場合は、[異常をフラグ付け]チェックボックスを選択します。異常のあるレコードでは、[異常フラグ]列にフラグが表示されます。異常のないレコードでは、この列は空のままになります。この列を使用すると、実行する処理を決定する前に、異常なレコードを確認またはフィルターできます。

フィルターを適用するには

この加工と併せてフィルターを適用する場合は、フィルター機能を使用できます。

1. [フィルター]タブをクリックします。

2. アイコンをクリックし、[フィルター]セクションに必要な列を追加します。ドラッグ&ドロップでフィルターの順序を変更することもできます。




3. 追加した各列について、ドロップダウンから次のいずれかの設定を選択できます。
  1. [実際の値]:列内の実際の値に基づいて行をフィルターできます。詳細はこちらをクリックしてください。
  2. [データの品質]:列内のデータの品質に基づいて行をフィルターできます。詳細はこちらをクリックしてください。
  3. [パターン]:選択した列内のデータのパターンに基づいて行をフィルターできます。詳細はこちらをクリックしてください。
  4. [周期]:四半期、月、週などの周期パラメーターに基づいて行をフィルターできます。詳細はこちらをクリックしてください。
  5. [異常値]:選択した列のデータに含まれる異常値に基づいて行をフィルターできます。詳細はこちらをクリックしてください。
    Notes
    メモ:フィルター設定は、フィルターに追加した列のデータ型に応じて表示されます。

    4. [フィルター]セクションに複数のフィルターを追加すると、各フィルターの横に論理演算子ANDまたはORが表示されます。クリックすると、論理演算子をANDとORで切り替えられます。
    1. 論理演算子を使用すると、条件を結合し、論理を適用して優先順位のルールを指定できます。最終的な式は[条件式]欄に表示されます。[編集する]をクリックすると、論理演算子と括弧を使用して標準の式を変更し、優先順位や、どの条件を最初に評価するかという実行順序を指定できます。必要な変更を行った後、[保存]をクリックします。
    1. たとえば、式「((1 OR 2) AND (3 OR 4))」では、最初に条件「(1 OR 2)」が実行され、次に条件「(3 OR 4)」が実行されます。その後、AND演算子が使用されているため、両方の条件が真の場合にフィルターが適用されます。
    5. 次のセクションでは、各フィルターで選択したフィルター設定に基づき、指定した値をさらに絞り込んで選択できます。



    たとえば、上の画像では、[フィルター]セクションの「すべての列」フィルターに[データの品質]設定が選択されています。この選択に基づいて、指定した値をフィルターするための詳細設定が[すべての列(データの品質)]セクションに表示されます。

    6. 最後のセクションでは、選択した項目を含めるか除外するかを選択できます。

    7. 何らかの理由ですべてのフィルターを削除する場合は、[クリア]ボタンを使用できます。

    8. 変更を行うと、フィルター加工のプレビューがリアルタイムで表示されます。

    9. [適用]ボタンをクリックし、フィルターと併せて加工を適用します。

    データを並べ替えるには

    並べ替え]タブでは、任意の列に基づいてデータを昇順または降順に並べ替えられます。[並べ替えに使用する列]ドロップダウンで列を選択し、並べ替え順を選択できます。

    この機能は加工と組み合わせる場合にのみ使用でき、単独では使用できません。ただし、データの並べ替えのみを行う場合は、 並べ替え加工を使用できます。



    関連情報