お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の
英語版を参照してください。
増分データ取得は、元データから新規または更新済みのファイルをインポートする方法です。Zoho DataPrepでは、詳細選択機能を使用して、次のクラウドストレージから増分データをインポートできます。
-
Google ドライブ
-
Zoho WorkDrive
-
Amazon S3
-
Dropbox
-
Box
-
Microsoft OneDrive
-
SharePoint
インポートを開始するには
1. 既存のパイプラインを開きます。パイプラインを作成する場合は、[ホーム]ページ、[パイプライン]タブ、または[ワークスペース]タブから作成します。パイプラインを開いたら、[データを追加]をクリックします。
情報:パイプラインの作成画面の上部にある[データのインポート]
アイコンをクリックして、複数の元データからパイプラインにデータを取り込むこともできます。
2. 左側の欄から[クラウドストレージ]カテゴリーを選択し、目的のクラウドストレージサービスをクリックします。検索欄でクラウドストレージサービスを検索することもできます。
メモ:すでにデータ連携を追加している場合は、左側の欄から[保存済みのデータ連携]カテゴリーをクリックし、インポートを続けます。保存済みのデータ連携の詳細については、こちらをクリックしてください。
3. すでにデータ連携を追加している場合は、既存のデータ連携をクリックし、データのインポートを開始します。
メモ:[新しく追加する]リンクをクリックすると、新規アカウントを追加できます。必要な数だけデータ連携を作成できます。
4. クラウドストレージのアカウントを認証します。初回のみ、DataPrepによるファイルへのアクセスを許可する必要があります。
情報:Zoho WorkDriveの場合、Zoho DataPrepへのログインに使用したWorkDriveアカウントからデータが直接取得されます。
メモ:データ連携の設定は、今後クラウドストレージからデータをインポートする際に使用できるよう保存されます。認証情報は安全に暗号化され、保存されます。
詳細選択による増分データのインポート
5. データを増分方式でインポートするには、[詳細選択]リンクをクリックします。
詳細選択では、正規表現に基づいてファイルを動的に選択できます。これにより、クラウドストレージのアカウントから新規または更新済みのデータを取得できます。ファイルのパターンに一致するデータファイルが、クラウドストレージサービスから取得されます。
各クラウドストレージサービスで詳細選択を使用する方法については、次のリンクを参照してください。
情報:クラウドストレージからの増分ファイルの取得では、CSV、TSV、JSON、XML、TXTのファイル形式のみサポートされています。
6. データのインポートが完了すると、ビジュアルパイプラインビルダーが開き、加工処理を適用できるようになります。また、ステージを右クリックして、[データを準備]を選択し、DataPrep Studioページでデータを準備できます。[こちらをクリック]すると、加工処理の詳細を確認できます。
7. データフローを作成し、各ステージに必要な加工処理を適用したら、ステージを右クリックして[エクスポート先を追加]し、データフローを完成させます。
8. パイプラインにエクスポート先を追加したら、まず手動での実行を使用してパイプラインを実行します。手動での実行が正常に動作することを確認したら、[実行を予約して]パイプラインを自動化できます。実行の種類については、[こちら]をご確認ください。
予約、バックフィル、手動での再読み込み、Webhook、Zoho Flowを設定する際は、すべての元データに対してインポート設定を行う必要があります。インポート設定を行わない場合、実行を保存できません。インポート設定の方法については、[こちらをクリック]して確認してください。
9. 実行を設定すると、実行時にパイプライン処理が作成されます。処理の概要では、処理のステータスと詳細情報を確認できます。[こちらをクリック]すると、処理の概要について詳しく確認できます。
詳細選択のインポート設定
詳細選択を使用してクラウドストレージからデータをインポートする場合、次の[インポート設定]オプションで、クラウドストレージからのデータのインポート方法と増分データの取得方法を設定できます。
インポート設定を行うには、[こちらをクリック]を選択します。
次の画像は、予約設定の例です。

元データからのデータのインポート方法
ドロップダウンからデータのインポート方法を選択します。[すべてのデータをインポートする]、[増分ファイルの取得]、[データをインポートしない]から選択できます。
[すべてのデータをインポートする]
このオプションでは、ファイルのパターンに一致する利用可能なすべてのデータがインポートされます。

[ファイルのバッチサイズ]: すべてのファイルをインポートする場合のバッチサイズを指定します。ファイルは最初の更新日時に基づき、指定した数ごとにグループ化されます。各グループのファイルは1つのファイルとしてインポートされ、実行のたびにエクスポート先へエクスポートされます。
情報:ファイルのバッチサイズに10を超える値は指定できません。このオプションは、クラウドストレージの詳細選択でのみ使用できます
[増分ファイルの取得]
データのインポート方法と増分データの取得方法は、クラウドストレージの[インポート設定]オプションで設定できます。増分データのインポートは、元データから新規または更新済みのレコードをインポートする方法です。

[新しいデータがない場合は前回インポートしたデータを使用する]:
- チェックボックスをオンにした場合:元データに新しいデータがないと、前回取得したデータが再度インポートされます。
- チェックボックスをオフにした場合:元データに新しいデータがないと、インポートが失敗し、ファイルはインポートされません。その結果、パイプライン処理全体が失敗します。
[インポートするファイル]このオプションでは、[すべてのファイル]、[最新のファイル]、または[最も古いファイル]を選択してインポートできます。
[すべてのファイル]
このオプションでは、指定したファイルのパターンに一致するすべてのファイルのうち、[取得基準]項目に基づく特定の期間内にあるファイルのみがインポートされます。
[取得基準]:ファイルの並べ替えとインポートの基準にする日時を、[更新日時]、[作成日時]から選択できます。
メモ:Google ドライブ、OneDrive、SharePoint、Boxには、modifiedTimeとcreatedTimeがあります。
DropboxとAmazon S3にはmodifiedTimeのみがあり、作成日時はありません。
[ファイルのバッチサイズ]:すべてのファイルを増分でインポートする場合のバッチサイズを指定します。特定のデータの範囲内における最初の作成日時または更新日時に基づき、指定した数ごとにファイルがグループ化されます。グループ化されたファイルは、実行のたびに1つのファイルとしてインポートされ、エクスポート先に出力されます。
情報:ファイルのバッチサイズには10を超える値を指定できません。この設定は、クラウドストレージの詳細選択でのみ使用できます。
[最新のファイル]
この設定では、特定のデータの範囲内で指定したファイルのパターンに一致する最新のファイルを、[取得基準]項目に基づいてインポートします。

[最も古いファイル]
この設定では、特定のデータの範囲内で指定したファイルのパターンに一致する最も古いファイルを、[取得基準]項目に基づいてインポートします。

[データをインポートしない]
データは初回のみインポートされます。2回目以降は、同じデータにルールが適用され、エクスポートされます。

増分同期の仕組み
元データから増分データをインポートして取得する方法は、[インポート設定]で指定できます。増分データのインポートとは、新規または更新済みのレコードを特定のデータの範囲内でインポートする方法です。
増分ファイルの取得では、パイプラインを実行すると、新規または更新済みのファイルが取得されます。データの範囲ごとに、前回のデータの範囲より後に作成または更新されたファイルがインポートされます。クラウドストレージに新しいファイルがない場合、データはインポートされないか、インポート設定に応じて以前にインポートしたデータが再取得されます。次のデータの範囲では、その範囲内で作成または更新されたファイルが取得され、以降も同様に処理されます。
予約実行での増分取得
増分ファイルの取得では、パイプラインを予約すると、最初の予約におけるデータの範囲は、前の範囲から現在のデータの範囲までとなります。この範囲内にある新規または更新済みのファイルがすべて取得されます。2回目の予約では現在の範囲から次の範囲までが対象となり、それ以降も同様に処理されます。
たとえば、予約間隔が1時間に設定されているとします。データソースには合計10件のファイルがあり、そのうちファイルのパターンに一致する5件が1時間前にアップロードされています。インポート設定では、すべてのファイルを増分でインポートするように設定されており、バッチサイズは10です。
最初の予約を実行すると、過去1時間以内に作成/modifiedされた5件のファイルが取得され、1つのファイルとしてエクスポートされます。
2回目の予約時に、同じファイルのパターンに一致する4件の新しいファイルが元データに追加された場合、その範囲内における元データの作成/modified日時に基づいて、その4件のみが取得され、1つのファイルとしてエクスポートされます。
3回目の予約時に、ファイルのパターンに一致する13件の新しいファイルが元データに追加された場合、バッチサイズが10に設定されているため、元データの作成/modified日時に基づいて最初の10件のみが取得され、1つのファイルとしてエクスポートされます。以降の予約における増分取得でも、ファイルに同じ処理が適用されます。
予約実行の詳細はこちらをご参照ください。
バックフィルの実行での増分取得
増分ファイルの取得では、パイプラインにバックフィルの実行を設定すると、指定したデータの範囲内にあるすべての増分ファイルが取得されます。
たとえば、バックフィルが8月1日から3日まで、処理頻度が毎日に設定されているとします。8月1日には4件、8月2日には7件、8月3日には13件のファイルがあります。インポート設定では、バッチサイズを10として、すべてのファイルを増分で取得するように設定されています。
最初のバックフィル処理では、8月1日に作成または更新された4件のファイルが取得され、1つのファイルとしてエクスポートされます。2回目のバックフィル処理では、8月2日の7件のファイルが同様に処理され、エクスポートされます。3回目のバックフィル処理では、8月3日の最初の10件のファイルが取得され、1つのファイルとしてエクスポートされます。
バックフィルの実行の詳細はこちらをご参照ください。
データの再読み込み時の増分取得
増分ファイルの取得では、パイプラインに再読み込みを設定すると、指定したデータの範囲内にある新規または更新済みのファイルがすべて取得されます。

たとえば、再読み込みの範囲が8月1日から2日までに設定されているとします。
8月1日には3件、8月2日には4件のファイルがあります。インポート設定では、最も古い作成日時に基づいて、バッチサイズを5としてすべてのファイルを増分で取得するように設定されています。
再読み込み処理では、8月1日に作成された3件のファイルと、8月2日に作成された最初の2件のファイルが取得され、1つのファイルとしてエクスポートされます。
再読み込みの詳細はこちらをご参照ください。
関連情報