Zilliz は、オープンソースのベクター データベースである Milvus v3.0 を公開し、本番 AI 開発者向けにレイクネイティブのデータ アクセスとアップグレードされた検索エンジンを追加しました。
Lake ネイティブ アーキテクチャでは、生データをスタンドアロン データベースに複製するのではなく、オープン形式でクラウド オブジェクト ストレージに保持します。 Zilliz は、6 月のパブリック プレビューで Vector Lakebase コンセプトを発表しました。 CEO の Charles Xie 氏は、これを、データのコピー、移行、並列ストレージ スタックを必要とせずに、リアルタイム クエリ、データ探索、マルチペタバイトの AI トレーニング パイプラインを可能にする統合データ基盤であると説明しました。統合オブジェクト ストレージ層は、低遅延のオンライン ベクトル検索と、同一のソース ファイルに対する大規模分析の両方をサポートします。
Zilliz の共同創設者兼 CTO の James Luan 氏は、「Milvus 3.0 は、既存のデータ ストア上で本番環境の取得を直接実行し、最新の AI ワークロードのためのより強力なエンジンを提供します。この同じコアが Zilliz Vector Lakebase を強化し、柔軟なスケーリング、簡素化された運用、および大規模な AI データ管理のためのエンタープライズ グレードのツールで強化されています。」
ベクトル データベースは、テキスト、画像、その他のコンテンツの数値ベクトル埋め込みを保存し、類似性検索を強化します。 Zilliz 氏によると、Milvus は世界で最も広く使用されているオープンソースのベクトル データベースであり、RAG、レコメンデーション エンジン、AI エージェントとして 10,000 社以上の企業に採用されており、1 億件を超える Docker プルが記録されています。
従来の AI パイプラインは、リアルタイムの取得とオフライン分析のために個別のデータ コピーを維持するため、追加のストレージ コスト、長時間にわたるデータ エクスポート、同期パイプライン、および大きな運用オーバーヘッドが発生します。
Milvus 3.0 のコア機能
1.外部コレクション: Lance、Iceberg、Parquet、または Vortex の Lake ファイル上に Milvus コレクションを作成します。このシステムは、ソース データにベクトル、フルテキスト、JSON、スカラー インデックスを重複なく構築し、標準のネイティブ API 経由で公開します。増分同期は、レイク データの変更に応じてインデックスを自動的に更新します。
2.ルーンストレージエンジン: 新しいマニフェストベースのエンジンは、デフォルトのカラムナ形式としてオープンな Arrow 互換の Vortex を使用して、低レイテンシのオブジェクト ストレージ ルックアップのための読み取り増幅をカットします。
3.ポイントインタイムスナップショット: 軽量の読み取り専用コレクション スナップショットにより、本番書き込みを中断することなく、オフラインの重複排除、評価、検証ジョブを安定したデータセット上で実行できます。
4.Sparkコネクタとバッチオペレータ: Spark DataSource V2 コネクタは、Milvus を Spark、Databricks、EMR バッチ ワークフローと統合し、重複排除とクラスタリングのためのネイティブ ベクター バッチ機能を統合します。

標準の Top-K ベクトル検索では、距離計算によって最も類似したベクトルのみをフェッチしますが、ベクトル数と次元が高いとスケーリングが不十分になります。 Milvus 3.0 は、基本的な最近傍検索をはるかに超えて検索を拡張します。
1.サーバー側の並べ替え、集計、およびファセット検索は、セマンティックな類似性とメタデータ フィルター (タイムスタンプ、価格、カテゴリ、テナントなど) を組み合わせ、クライアント側の後処理を排除します。
2.StructList マルチベクトル取得は、複数の埋め込み (ドキュメント チャンク、画像パッチ、マルチモーダル製品データ) を持つエンティティをサポートし、ColBERT や ColPali などの遅延インタラクション モデルと連携します。
3.最適化されたスパース インデックスは、SINDI 学習スパース ベクトル、組み込み MinHash、Nullable ベクトル フィールド、カスタム フルテキスト辞書、および広範な Faiss インデックス互換性と組み合わせて、元のリコール パフォーマンスと同等のストレージ フットプリントを最大 70% 削減します。
Luan 氏は、実稼働 AI ワークロードには、データベース内でネイティブにランキング、グループ化、マルチベクトル ルックアップが必要であり、v3.0 では、より豊富なエンジン内処理とともに高速なオブジェクト ストレージ アクセスを実現するためにストレージが作り直されたと付け加えました。
この統合コアは、セルフホスト型オープンソース Milvus とフルマネージド Zilliz Cloud の両方を強化します。 Zilliz Cloud は、ベース エンジンを完全な Vector Lakebase に拡張し、エラスティック コンピューティング、検出ツール、バッチ分析、統合インデックス付け、エンタープライズ ガバナンス、単一ソースの AI データの自動化を備えています。
業界の競争環境
このアップデートにより、検索レイテンシの削減を競うライバルの Pinecone、Qdrant、Weaviate に対する圧力が高まります。Qdrant は 4 月に、より高速なインデックス作成、高可用性クラスター、コンプライアンス監査ログを開始しました。 Pinecone は、エージェントのワークフローを高速化するために、事前計算されたベクター セットとコンポーザブル レトリバーを 5 月に公開しました。
純粋なベクター データベース ベンダーは、Regatta、SingleStore、SurrealDB などのマルチモデル プラットフォームと競合します。これらは Databricks や Snowflake などのレイクハウスと統合されていますが、より深いデータベース間のパートナーシップはアーキテクチャとストレージ エンジンの障壁に直面しています。市場では、ベクター プレーヤーがネイティブの構造化、グラフ、ドキュメント、または時系列のサポートを今後追加する可能性があります。
可用性
Milvus 3.0 は、引き続き Apache 2.0 ライセンスに基づく LF AI & Data 段階的プロジェクトであり、エアギャップ環境を含む Docker または Kubernetes 経由でデプロイ可能で、S3、GCS、Azure Blob オブジェクト ストレージとの互換性があります。初期の SDK の対象範囲には Python、Go、Node.js が含まれており、今後 Java もサポートされる予定です。ソース コード、リリース ノート、クイックスタート ガイドは、開発者サポートのためのコミュニティ オフィス アワーと並行して GitHub でホストされています。
マネージド Zilliz Cloud には、コア インデックス レイヤーとして Milvus 3.0 が組み込まれており、単一の共有データ コピー全体に企業の弾力性、セキュリティ、統合された操作が追加されます。
脚注
外部コレクションは、データ移行なしでゼロコピーのレイク インデックスを実装します。 Loon は、これまで低遅延ベクトル クエリのオブジェクト ストレージを制限していた読み取り増幅のボトルネックを解決します。
北京乾興解放科技有限公司
サンディ・ヤン/グローバル戦略ディレクター
WhatsApp / WeChat: +86 13426366826
電子メール: yangyd@qianxingdata.com
ウェブサイト: www.qianxingdata.com/www.storagesserver.com
ビジネスの焦点:
ICTプロダクト流通/システムインテグレーション&サービス/インフラソリューション
20 年以上の IT 流通経験を持つ当社は、主要な世界的ブランドと提携して、信頼性の高い製品とプロフェッショナルなサービスを提供しています。
「テクノロジーを活用してインテリジェントな世界を構築する」信頼できる ICT 製品サービス プロバイダー!