Amazon S3からのデータのインポート

Amazon S3からのデータのインポート

お知らせ:当社は、お客様により充実したサポート情報を迅速に提供するため、本ページのコンテンツは機械翻訳を用いて日本語に翻訳しています。正確かつ最新のサポート情報をご覧いただくには、本内容の英語版を参照してください。




0:: Zoho DataPrepでは、クラウドストレージサービスのAmazon S3からデータをインポートできます。Amazon Simple Storage Service(Amazon S3)はAWSが提供するサービスで、Webサービスインターフェースを通じてオブジェクトストレージを利用できます。

Info
1:: 重要事項
2:: Amazon S3のデータをZoho DataPrepに接続する前に、Amazon S3アカウントで次の権限を有効にする必要があります。
3:: 1. ListAllMyBuckets
4:: 2. Get BucketLocation
5:: 3. ListBucket
6:: 4. GetObject
7:: これらの権限を付与する方法については、Amazon S3のヘルプページを参照してください。

12:: Amazon S3からデータをインポートするには

13:: 1.14:: 既存のパイプラインを開くか、15:: パイ16:: プラインを17:: 18:: [ホーム]19:: ページ、20:: [パイプライン]21:: タブ、または22:: [ワークスペース]23:: タブから作成し、24:: [データを追加]25:: をクリックします。
Info26:: 情報:パイプラインビルダー上部の27:: [データをインポート]28:: アイコンをクリックして、複数のデータ元からパイプラインにデータを取り込むこともできます。



29:: 2. 左側の欄から30:: [クラウドストレージ]31:: カテゴリーを選択し、32:: [Amazon S3]33:: からインポートするには、34:: [Amazon S3]35:: アイコンをクリックします。検索欄で、目的のクラウドストレージサービスを検索することもできます。
 


Notes36:: メモ:以前に37:: Amazon S338:: の接続を追加している場合は、左側の欄から39:: [保存済みの接続]40:: カテゴリーをクリックし、インポートを続行します。保存済みの接続についての詳細は、41:: こちら42:: をクリックしてください。

43:: 3. 44:: 45:: Amazon S346:: アカウントを認証します。初回の認証時には、ファイルへのアクセスをZoho DataPrepに許可する必要があります。

47:: 4. 必要な情報を、
48:: [接続名]49:: 、50:: [アクセスキー]51:: 、および52:: [シークレットキー]53:: の各項目に入力します。

54:: 5. 認証情報を使用してアカウントを認証するため、55:: [Amazon S3を認証]56:: ボタンをクリックします。




Notes
57:: メモ:Amazon S3のデータに今後アクセスするため、接続設定が保存されます。認証情報は安全に暗号化されて保存されます。

58:: 6. 59:: すでに接続を作成している場合は、既存の接続タイルを表示できます。接続タイルをクリックするだけで、データのインポートを開始できます。



Notes60:: 新しいAmazon S3アカウントを追加するには、61:: [新規追加]62:: リンクをクリックします。必要な数だけAmazon S3接続を作成できます。

63:: 7. 必要なバケットを選択し、インポートするファイルを選択します。64:: [インポート]65:: ボタンをクリックします。66:: 高度な選択オプションを使用して、特定のパターンに一致するファイルをインポートすることもできます。 67:: こちらをクリック68:: して詳細をご確認ください。



69:: 8. 70:: [インポート]71:: をクリックします。すぐに72:: パイプラインビルダー73:: ページに移動し、インポートはバックグラウンドで実行されます。
74:: メモ:対応形式はCSV、TSV、JSON、XML、TXT、XLS、XLSXです。ZIP形式のファイルもインポートできます。

75:: ZIPファイルの場合、サポートされるファイルは1つのみです。.Zipファイル内に含まれるファイルが1つだけであることを確認してください。
76:: 9. 77:: 追加の入力が必要なファイルがある場合、78:: [対応が必要]79:: インジケーター 80:: がパイプラインビルダーのヘッダーに表示されます。81:: [対応が必要]82:: をクリックすると、確認が必要な各ファイルを一覧表示するインポートパネルが開きます。各ファイルについて、次の操作を行います。
  • 83:: ファイルがパスワードで保護されている場合は、用意された項目にパスワードを入力します。
  • 84:: ファイルに複数のシートが含まれている場合は、インポートするシートを選択し、85:: [インポート]86:: をクリックします。


87:: HTML、XLS、XLSXファイルの場合は、88:: [プレビュー]89:: オプションをクリックしてデータのサンプルを表示できます。
 

90:: 10. 91:: インポートが完了したら、ETLパイプラインに変換を適用できます。92:: ステージを右クリックして93:: [データの準備]94:: オプションを選択し、 95:: DataPrep Studioページでデータを準備することもできます。96:: こちらをクリック 97:: して、変換の詳細を確認してください。




98:: 11. データフローの作成とステージへの必要な変換の適用が完了したら、ステージを右クリックして99:: [出力先を追加]100:: し、データフローを完了できます。

Notes101:: メモ:パイプラインに出力先を追加した後は、102:: まず手動実行でパイプラインの実行を試すことができます。手動実行が動作することを確認したら、103:: スケジュール104:: を設定してパイプラインを自動化できます。各種実行については105:: こちら106:: をご確認ください。

107:: 高度な選択

108:: 高度な選択を使用してファイルをインポートするには、

109:: 1.  110:: [高度な選択] 111:: リンクをクリックします。



112:: 高度な選択を使用すると、正規表現に基づいて動的にファイルを選択できます。 113:: Amazon S3バケットから新規データまたは差分データを取得するために使用できます。前回の同期後に追加または変更されたファイルのうち、ファイルパターンに一致するファイルがS3バケットから取得されます。差分取得の詳細については、114:: こちらをご確認ください。

Info
115:: 重要:高度な選択は差分取得だけに使用されるものではありません。このオプションは、ファイルパターンに基づいてファイルを一括インポートする場合にも使用できます。

 

116:: 2. 次の詳細を入力します。

  • 117:: [バケット名] 118:: :データのインポート元となるバケット名。

  • 119:: [フォルダーのパス]120:: :ファイルを検索するフォルダーのパスです。121:: 例:122:: 2023/
    123:: ファイルがフォルダーに格納されず、バケット直下にある場合、この項目は空のままにできます。

    Alert
    124:: [フォルダーのパス]はディレクトリパスの項目であり、正規表現パターンには対応していません。

    Info125:: 情報:126:: フォルダーのパスでは、大文字と小文字が区別されます。

  • 127:: [ファイルパターン]128:: :バケット内のファイル名との照合に使用するパターンです。正規表現による照合に対応しています。また、指定したパス内のすべてのファイルに一致させるには、「.*」パターンを使用できます。

Info129:: 情報:130:: ファイルパターンでは、大文字と小文字が区別されます。
Notes
131:: メモ:ファイルパターンの照合には、単純な正規表現が使用されます。たとえば、Sales_2022.csv、Sales_2023.csv、Sales_2024.csvなどのファイル名を持つファイルを取得するには、パターンとして132:: Sales_.*を入力します。

133:: 同様に、PublicData1.csv、PublicData2.csv、PublicData3.csvなどのファイルを取得するには、134:: Public.*を使用します。

135:: 1件のファイルのみをインポートする場合は、正確なファイル名を使用してパターンを指定します。
136:: 例:leads_jan_2022.*
  • 137:: [サブフォルダーを含める]138:: :ファイルの検索時にサブフォルダーも対象にする場合は、[139:: サブフォルダーを含める140:: ]チェックボックスを選択します。

  • 141:: [ファイルのパスワード]:142:: ファイルがパスワードで保護されている場合は、パスワードを入力します。
  • 143:: [ファイルを統合してインポート]144:: - 指定したパターンに一致するすべてのファイルを統合し、1件のデータセットとしてインポートします。

    145:: この設定を使用すると、インポート後にユニオンを実行することなく、インポート時にファイルを統合できます。
    Info146:: 情報:147:: この設定で一度に統合できるファイルは、最大5件です。
    Notes148:: メモ:このチェックボックスを選択しない場合、一度に取得されるファイルは1件のみです。

    149:: 例:150:: S3アカウントに10件のファイルがある場合、最初の5件が1件のデータセットに統合され、インポートされます。次回の再読み込み時に、残りの5件が統合され、インポートされます。

    151:: 同様に、S3アカウントに8件のファイルがある場合、最初の5件が統合されて取得され、その後、残りの3件が取得されます。

  • 152:: [ファイルの種類]153:: :154:: 必要なファイル形式を選択します。使用できる形式は、CSV、TSV、JSON、XLS、XLSX、XML、TXTです。
  • 155:: [シートパターン]156:: :この設定は、XLS形式とXLSX形式でのみ使用できます。157:: ファイル内のシート名との照合に使用するパターンです。正規表現による照合に対応しています。また、ファイル内のすべてのシートに一致させるには、「.*」パターンを使用できます。

    Notes
    158:: シートパターンの照合にも、単純な正規表現が使用されます。たとえば、Sales_2022、Sales_2023、Sales_2024などの名前のシートを取得するには、パターンとしてSales_.*を入力します。

    159:: 同様に、PublicData1、PublicData2、PublicData3などのシートを取得するには、Public.*を使用します。

    160:: 1件のシートのみをインポートする場合は、正確なシート名を使用してパターンを指定します。
    161:: 例:Leads_Jan_2022.*
  • 162:: 情報:シートパターンでは、大文字と小文字が区別されます。

  • 163:: [シートのパスワード]:164:: この設定は、XLS形式とXLSX形式でのみ使用できます。シートがパスワードで保護されている場合は、パスワードを入力します。
  • 165:: [シートを統合してインポート]:166:: 指定したパターンに一致するすべてのシートを統合し、1件のデータセットとしてインポートします。

167:: この設定を使用すると、インポート後にユニオンを実行することなく、インポート時にシートを統合できます。

Notes168:: メモ:このチェックボックスを選択しない場合、一度に取得されるシートは1件のみです。
169:: 3. [170:: インポート171:: ]ボタンをクリックします。172:: すぐに173:: パイプラインビルダー174:: ページに移動し、バックグラウンドでインポートが実行されます。




Notes175:: メモ:対応している形式は、CSV、TSV、JSON、XML、TXT、XLS、XLSXです。圧縮ファイルもインポートできます。

176:: Zipファイルの場合、対応しているファイルは1件のみです。.Zipファイル内に圧縮されているファイルが1件だけであることを確認してください。

177:: ファイル解析

178:: ファイル解析179:: とは、インポート時にファイルを解釈して構造化し、処理できるようにデータを行と列に正しく整理する処理です。

180:: 181:: ファイル解析182:: には、183:: 自動解析184:: と185:: カスタム解析186:: の2つの設定があります。

  1. 187:: 自動解析188:: - ファイル構造(区切り文字、見出し、文字コードなど)を自動的に検出し、それに応じてデータを整形します。
  2. 189:: カスタム解析190:: - ファイルの読み取り方法を手動で設定でき、区切り文字、見出し、文字コードなどの設定を詳細に制御できます。

191:: カスタム解析192:: には、次の設定があります。

  • 193:: [ファイルの文字コード]:194:: [ファイルの文字コード]オプションでは、UTF-8などの195:: 文字コード196::を使用してファイルをエンコードできます。

  • 197:: [テキスト修飾子]:198:: 単一引用符(')や二重引用符(')など、テキスト項目の開始位置と終了位置を示す文字を指定できます。

  • 199:: [区切り文字]:200:: コンマ(,)、セミコロン(;)、スペース、タブ、パイプ(|)などの区切り文字を使用して、データを分割できます。また、独自の区切り文字を指定できる201:: [カスタム区切り文字]202::オプションもあります。

  • 203:: [先頭行のスキップ]:204:: ファイルの先頭から指定した行数を解析対象から除外します。

  • 205:: [コメント文字]:206:: コメント行の先頭文字を指定します。コメント行はインポート時にスキップされます。

  • 207:: [エスケープ文字]:208:: 区切り文字や引用符を書式なしテキストとして処理するために使用するエスケープ文字を指定します。使用可能なオプションは、二重引用符(')、バックスラッシュ()、パイプ(|)、キャレット(^)、チルダ(~)です。

  • 209:: [スペースの自動削除]:210:: データのインポート時に、すべての列の先頭と末尾にある空白を削除します。

  • 211:: [データに見出しを含む]:212:: 列見出しとして使用する行番号を指定します。


213:: ファイル解析オプション

214:: 以下の表では、クラウドストレージサービスからファイルをインポートする際のオプションについて説明します。



215:: 関連情報

216:: 新しい217:: パイプラインを追加するには?

218:: クラウドデータベースからデータをインポートするには?

219:: 保存済みのデータ接続からデータをインポートするには?

220:: パイプラインを予約設定するには?        

221:: Zoho DataPrepでは、他にどのクラウドストレージを利用できますか? 

222:: Amazon S3にデータをエクスポートするには?