DataPrep 2.0のリリースをお知らせします。新バージョンでは、エンドツーエンドのパイプラインを簡単に構築でき、データの品質やデータ移動を包括的に管理できます。また、DataPrep 2.0では複数のソースとエクスポート先にわたるデータ連携が強化され、ETLプロセス全体の効率が向上します。DataPrep 2.0の最新情報をご紹介します。

企業から小規模な組織まで利用でき、複雑な用途にもシンプルな用途にも対応可能な、習得しやすい包括的データパイプラインプラットフォームの開発に注力しました。
これらの方針に基づき、Zoho DataPrepの新しいメジャーリリースでは、次の5つの領域に重点を置いて開発しました。
データパイプラインの基本機能
Zoho DataPrepの基本機能の強化は、変化し続けるお客さまのニーズに対応するためのものです。Zoho DataPrepは、数十億行まで拡張可能な変換エンジンを基盤とし、コーディング不要のポイント&クリック操作画面から利用できる250種類以上の組み込み変換機能を備えています。
Zoho DataPrepにおける高度なデータ準備
2.0では、Zoho DataPrep内でのデータ準備、処理の統合管理、実行方法が大幅に更新されています。
準備の各ステージを個別のデータセットとして扱うのではなく、データパイプライン全体を1つの単位として自分で管理できるようになりました。
インポート、処理、エクスポートを個別に順序設定したり、予約日時を手動で調整したりすることなく、1つの予約済み処理として実行するよう設定できるようになりました。
2.0では、増分取得で取得されるデータが、前回のインポートではなく予約間隔に基づくようになりました。これにより、データ移動が簡素化され、失敗した処理を簡単に再開できます。
Zoho DataPrep 2.0では、以下の機能によって、これらをはじめとするさまざまな変更が導入されています。
全面的に刷新されたパイプラインキャンバスでは、エンドツーエンドのデータフローをスムーズに設計できます。以前は一度に1つのデータセットしか扱えませんでしたが、2.0では複数のソースからデータを取得し、複数のデータセットを同時に準備して使用できるほか、複数のエクスポート先にデータをエクスポートできます。これにより、データをより分かりやすく可視化し、複雑なワークフローやデータ連携を簡素化して、安心してデータを扱うことができます。詳細はこちら

DataPrep 1.0では、元データとエクスポート先に別々の予約が設定されており、予約時間をずらして手動で管理する必要があったため、管理が困難でした。2.0では、パイプライン単位で予約を設定できるようになりました。1件の予約で、パイプライン内のすべての元データとエクスポート先について、インポート、処理、エクスポートを一括管理できます。詳細はこちら
パイプラインを実行するたびに増分取得オプションを選択すると、元データから新規および更新済みのデータのみが取得され、処理のためにDataPrepに送信されます。新たに追加された行のみが処理されるようになったため、増分取得をより短時間で実行できます。これにより、処理をより効率的かつ費用対効果の高い形で実行できます。詳細はこちら

データモデルやデータ準備ワークフローの変更により、前回までの予約で処理されなかったデータを処理できます。特にファイルベースのデータパイプラインでは、すべてのデータ処理を1件ずつ実行する必要はありません。詳細はこちら
作成したデータパイプラインをパイプラインテンプレートとして保存できるようになり、データパイプラインを簡単に再利用、複製できます。詳細はこちら
データの準備やクレンジングに関するさまざまな用途に対応できるよう、各種パイプラインやルールセットをあらかじめ作成されたテンプレートとしてギャラリーで公開しています。ユーザーはこれらのテンプレートを利用して、データ準備をすぐに開始できます。詳細はこちら

ルールセット全体を保存する代わりに、選択したルールのみをテンプレートとして保存できるようになりました。また、特定の機能を持つマクロも柔軟に保存できます。
自動データパイプラインを構築できるかどうかは、さまざまなデータソースやエクスポート先と連携できるプラットフォームの機能に大きく左右されます。この点を踏まえ、Zoho DataPrepに多数のコネクターを追加します。Zoho Creator用コネクターに続き、DataPrep 2.0の正式リリースまでに、以下のコネクターを順次提供する予定です。

データパイプラインは同期処理中に失敗する可能性があるため、可能な限り高い耐障害性が必要です。Zoho DataPrepでは、処理基盤内に加え、データソースからのインポート処理やエクスポート先へのエクスポート処理にも自動再試行を導入し、データパイプラインの耐障害性を大幅に向上しました。
プラットフォームのパフォーマンスが5倍に向上し、DataPrepで1回のバッチにつき処理できるデータ量も増加しました。2021年の製品リリース時には、1回のバッチで100万行を処理できましたが、その後すぐに処理能力を500万行まで引き上げました。
バージョン2.0では、標準で1回のバッチにつき最大2,500万行を処理できます。また、要求に応じた特別な環境構築により、最大1億行まで拡張できます。
DataPrepがOpenAIのChatGPT APIと連携し、より高度なデータ加工や拡充が可能になりました。この連携により、サンプルデータを基にした加工処理、数式の作成、データセット検索などの機能を利用できます。

データをエクスポート先に送信する際、データモデルの不一致によりエクスポートの一部が失敗し、データのエクスポートを再開したり、データの整合性を維持したりすることが困難になる場合があります。これを防ぐため、データベースやアプリケーションなど、データ型に対応しているすべてのエクスポート先でスキーマが自動的に検証されます。
新しい監視機能と操作履歴機能により、Zoho DataPrepプラットフォームの可観測性が大幅に向上しました。改善点を1つずつ見ていきましょう。
各パイプラインの実行がジョブとして追跡されるようになり、各ステージのステータスも個別に追跡されます。ジョブのリストはパイプラインごとに表示され、手動での実行、スケジュール実行、バックフィル実行など、実行方法別に分類されます。詳細はこちら

各ジョブには3つのセクションがあります。最初のセクションには、各ステージのステータスが視覚的に表示されるほか、処理した行数、容量、所要時間、対象のジョブにおけるデータの範囲などの全体的な統計情報と、パイプライン実行の概要が表示されます。
2番目のセクションには、すべての処理ステージがリスト形式で表示されます。また、処理した行数やデータ処理の所要時間など、各ステージの詳細なステータスも確認できます。詳細はこちら
Zoho DataPrepのすべての処理を、新しいホームページである監視ダッシュボードから監視できるようになりました。新しいダッシュボードでは、システム内で成功または失敗したデータパイプラインの情報を確認できます。詳細はこちら

データパイプラインでのデータ準備中に行ったすべての変更は追跡され、バージョンとして保存されます。いつでも任意のバージョンに移動し、パイプラインをそのバージョンに戻すことができます。つまり、データパイプラインのライフサイクル全体を通じて、無制限に元に戻す/redoことができます。詳細はこちら
パイプラインでの作業が一定の段階に達し、パイプラインを予約する準備ができたら、パイプラインを準備完了として設定できます。準備完了として設定すると、そのパイプラインのバージョンが有効なバージョンとして設定されます。その後の変更はすべて下書きバージョンとして追跡され、予約済みの処理には影響しません。変更が完了したら、パイプラインを再度準備完了として設定することで、予約済みの処理に変更を反映できます。これにより、本番環境のパイプラインに影響を与えることなく、データのテストや検証を継続できます。詳細はこちら
組織のデータを複数の関係者が利用できる場合、誰がどのデータにアクセスしたかを把握することが重要です。この機能では、Zoho DataPrep内のデータワークフローのどの部分にどのユーザーがアクセスしたかを監視できます。これにより、アクセスと操作の監査ログを通じて、データのセキュリティと説明責任を向上できます。詳細はこちら
効率的なデータ準備ソリューションには、さまざまなデータソースやエクスポート先とのシームレスな連携が不可欠です。絶えず変化するビジネスニーズに合わせて、組織が独自のデータソリューションを柔軟に構築できるよう、プラットフォームの機能を拡張しました。
Zoho Flowとの緊密な連携により、Zoho DataPrepをさまざまなソフトウェアやソリューションと連携し、コードを記述せずにデータワークフローを自動化できます。これは、Zoho Flowからデータパイプラインを制御できるシンプルな連携機能です。Zoho Flow内の処理としてデータパイプラインを実行できるほか、処理の成功、失敗、完了などのDataPrepトリガーを使用してフローを開始できます。
独自ブランドとして全面的に刷新したZoho DataPrepを活用し、データ関連サービスを効果的に強化できます。DataPrepのホワイトラベル版を利用すれば、わずかなコストでプロフェッショナルなデータサービスを提供できます。ITの専門家やデータアナリストがいなくても、データを簡単に分析して準備できます。
連携機能をより迅速に構築できるよう、Zoho DataPrepのREST APIエンドポイントを公開します。近日中に、すべてのユーザーが利用できるようになります。Zoho DataPrep内で構築したデータパイプラインを、他のアプリケーションやプロセスと連携したREST APIを通じて管理できるようになりました。データパイプラインの開始や停止、処理のステータス情報の取得が可能になります。
リアルタイムのデータ品質監視
データセットの詳細情報パネルを開かずに、データの品質を監視できるようになりました。データの品質はDataPrepのStudioページ上部に常に表示され、データが変更されるたびにリアルタイムで更新されます。
列の検索
100列を超えるデータセットでは、目的の列を見つけたり、作業対象の列に移動したりすることが困難な場合があります。列の検索を使用すると、目的の列を簡単に探せます。また、データの品質で列をフィルターし、品質上の問題がある列を優先的に確認できます。データを準備する際には、Studioページで不要な列を一時的に隠し、重要な列に集中することもできます。詳細はこちら
ルールセットの一括処理
ルールセットに対して一括処理を実行できるようになりました。複数のルールを一度に選択して、削除、無効化、または有効化できます。適用済みのすべてのルールをクリアし、最初からやり直すこともできます。詳細はこちら
ルールセットテンプレートのファイルへのエクスポート
ルールセットテンプレートをデータとして保存し、DataPrepの組織内で共有するだけでなく、ルールセットをファイルとしてエクスポートできるようになりました。このファイルを使用して、別の組織のユーザーとテンプレートを共有したり、顧客にプロフェッショナルサービスを提供したり、変更履歴を管理するために外部のバージョン管理システムへ保存したりできます。詳細はこちら
複数ファイルの一括インポート
システムにファイルをインポートする際に、複数のファイルを統合して1つのデータセットにできるようになりました。ローカルファイルシステムやクラウドストレージからファイルをインポートする場合は、高度なインポート手順で、インポート時にファイルを統合するよう選択できます。一度に最大10件のファイルを統合できます。詳細はこちら
アプリ向けデータ構造の照合機能の強化
データ構造の照合は、データベースだけでなく、Zoho DataPrepで利用可能なすべてのアプリのエクスポート先でも使用できます。これにより、エクスポート先のアプリで必要とされるデータ型や制約を適切に管理し、復旧が困難な部分的エクスポートエラーを回避できます。詳細はこちら
フィルターと並べ替え機能の強化
Zoho DataPrepのすべての加工処理に、フィルターと並べ替えのパネルがタブとして追加されました。加工処理とフィルターや並べ替えの機能を組み合わせられるため、これらの処理を個別に実行する手間を省けます。
ローカルファイルシステムからのファイルの自動インポート
クラウドやFTPシステムにデータを転送することなく、ローカルマシンからファイルをインポートして、ライブパイプラインを設定できるようになりました。ローカルマシンとクラウド上のDataPrepサービスを接続するデータブリッジを使用して、ローカルマシン内のファイルを取得できます。また、S3やGoogle ドライブなどのクラウドストレージと同様に、増分取得にも対応しています。詳細はこちら
データソースとエクスポート先の管理機能の向上
データを再度インポートしてデータフローを作成し直すことなく、データセットのデータソースを変更できるようになりました。また、データベースやアプリの接続情報など、インポートまたはエクスポートのフローに関する詳細な設定も変更できます。
データとモデルの変更の自動反映
データパイプラインは複雑であり、同じパイプライン内の各部分に加えた変更を確認するために、何度も行き来する必要があります。親子関係が多数あるパイプラインでは、親データセットへの変更が子データセットに自動で反映されないと、作業に手間がかかります。2.0では、データとモデルへの変更が、パイプライン内の子ステージに自動で反映されます。変更は子ステージを開いたときに反映されるため、親データセットでの作業中は処理性能と速度を維持しながら、子データセットを開いたときには最新のデータとモデルを確認できます。
通知の詳細な管理
新しい通知設定により、受信する通知と表示しない通知を管理できるようになりました。通知ごとに、メール通知、製品内通知、両方、またはなしのいずれかを選択できます。詳細はこちら
共有操作の簡素化
DataPrepの新しいバージョンの開発にあたり、多くのユーザーがデータ閲覧専用のユーザーの役割を使用しておらず、一部のユーザーにとって分かりにくいことが判明しました。共有先の多くは、データ準備フローを作成するためにパイプラインで作業するユーザーでした。この調査結果に基づき、役割や権限を検討する手間なくデータパイプラインを共有できるよう、共有操作を簡素化しました。高度な機能を利用するユーザー向けには、それぞれの独自の要件に基づいてカスタムの役割を作成できる機能を開発中です。詳細はこちら
個人情報の一元監査
すべてのワークスペースで個人情報または電子的保護対象医療情報(ePHI)として指定された列が設定画面に一覧表示されるようになり、管理者はDataPrepのデータパイプラインを通過するすべての個人情報の概要を確認できます。この画面から対象のパイプラインに移動し、マスキング、トークン化、削除によってデータが保護されていることを確認することで、個人情報や医療情報を管理できます。詳細はこちら