logo
ホーム ニュース

会社のニュース WEKA ソフトウェアは、Oracle のパブリック クラウドでの長時間コンテキスト AI 推論を高速化します

認証
中国 Beijing Qianxing Jietong Technology Co., Ltd. 認証
中国 Beijing Qianxing Jietong Technology Co., Ltd. 認証
顧客の検討
北京Qianxing Jietongの技術Co.、株式会社の販売スタッフは非常に専門および忍耐強い。それらは引用語句をすぐに提供してもいい。プロダクトの質そして包装はまた非常によい。私達の協同は非常に滑らかである。

—— 《のFestfing DVの》 LLC

私がIntel CPUおよび東芝SSDを緊急に捜していたときに、北京Qianxing Jietongの技術Co.、株式会社からのサンディは私に多くの助けを与え、私に私がすぐに必要としたプロダクトを得た。私は実際に彼女を認める。

—— キティ円

北京Qianxing Jietongの技術Co.、株式会社のサンディは私がサーバーを買う時間の構成間違いを私に思い出させることができる非常に注意深いセールスマンである。エンジニアはまた非常に専門で、すぐにテスト プロセスを完了できる。

—— Strelkin Mikhail Vladimirovich

北京千星捷通との仕事は大変満足しています。製品の品質は素晴らしく、納期も常に守られています。営業チームはプロフェッショナルで、忍耐強く、私たちの質問にすべて丁寧に対応してくれます。彼らのサポートに心から感謝しており、長期的なパートナーシップを期待しています。強くお勧めします!

—— アフマド・ナビド

品質: 提供者との素晴らしい経験. MikroTik RB3011は既に使用されていましたが,非常に良い状態で,すべてが完璧に動作しています. コミュニケーションは迅速でスムーズでした.そして私の懸念はすぐに解決されました信頼性の高いサプライヤーです 強くお勧めします

—— ゲラン・コレシオ

オンラインです
会社 ニュース
WEKA ソフトウェアは、Oracle のパブリック クラウドでの長時間コンテキスト AI 推論を高速化します

Oracle Cloud Infrastructure (OCI) 上で実行される WEKA NeuralMesh および Augmented Memory Grid ソフトウェアは、ローカル DRAM のみに依存する標準の OCI 環境と比較して、10 倍高いトークン スループット、10 倍の同時ユーザー数、および GPU あたり 7 倍のトークンを実現します。

最新の会社ニュース WEKA ソフトウェアは、Oracle のパブリック クラウドでの長時間コンテキスト AI 推論を高速化します  0

WEKA の拡張メモリ グリッドは、NeuralMesh 経由で外部ストレージを活用することで AI 推論用の GPU サーバー メモリを拡張し、外部リソースを高性能 KV キャッシュに変えます。マイクロ秒の遅延と数 GB/秒の帯域幅を実現し、NVIDIA の SX KV キャッシュ アーキテクチャと完全な互換性を備え、最大ペタバイトの追加メモリ アドレス空間を提供します。 NeuralMesh は、WEKA の高性能 AI ファイル システムです。すべてのベンチマークは、100,000 トークンのコンテキスト ウィンドウを備えた 9 ノードの OCI ベアメタル H100 クラスターで検証されました。

OCIのソフトウェア開発シニアディレクターであるパブロ・セーラム氏は、「エンタープライズAIワークロードはコンテキストウィンドウを拡大し続け、GPU使用率を新たな限界まで引き上げている。これらのベンチマークは、WEKAのソリューションがOCI上のGPUメモリのボトルネックを解消し、追加のGPUハードウェア投資をすることなく、より大規模で要求の厳しい推論ワークロードを可能にすることを証明している」とコメントした。

WEKA は、推論需要の増大により AI インフラストラクチャの非効率性が増大すると指摘しています。 KV キャッシュのエビクションが頻繁に行われると、隠れたオーバーヘッドが発生し、GPU サイクルが無駄になり、レイテンシが増加し、ユーザー エクスペリエンスが損なわれ、トークンごとの運用コストが増加します。 100,000 トークンを超える入力を伴うロングコンテキストのエージェント AI ワークロードの場合、このようなオーバーヘッドは、本番 AI デプロイメントのユニットエコノミクスに深刻なダメージを与えます。

このベンチマークは、9 ノード、72 個の H100 GPU、100,000 トークンのコンテキスト ウィンドウ、および数千の同時ユーザーで構築されており、以下に示す明らかなパフォーマンス ギャップがあります。
  • 同時ユーザー容量: WEKA は 5,000 人を超える同時ユーザーをサポートしていましたが、DRAM のみのセットアップではわずか 600 人でした。アクティブ キャッシュを 8.64 TiB DRAM から 287 TiB NVMe フラッシュ ストレージに拡張することでキャッシュの飽和障害を防ぎ、追加の GPU を購入することなく既存の GPU ハードウェアの ROI を最大化します。
  • トークンのスループット: WEKA スタックは 1 秒あたり約 200 万トークンに達しました。これは、DRAM のみのシステムの 200,000 トークン/秒未満のベースラインよりも 10 倍高速です。
  • 総トークン処理量: 2,400 人の同時ユーザーによる 1 時間のテストでは、WEKA は 50 億のトークンを処理しましたが、DRAM のみのセットアップでは 7 億のトークンしか処理できませんでした。
エージェント AI ワークフローの場合、DRAM が不十分であると、キャッシュが飽和した後に継続的な GPU の再計算がトリガーされ、トークンごとのコストが上昇し、ROI が低下します。 WEKA は GPU ごとに 7 倍のトークンを処理するため、本番 AI サービスの全体的なトークン コストを大幅に削減します。

検索、要約、コード支援、マルチターン エージェントなどのリアルタイム AI サービスの場合、トークン スループットによって、ユーザー キャパシティ、応答速度、インフラストラクチャ収益の可能性に対するサービス制限が定義されます。スループットが 10 倍向上することで、OCI クラスター内のネイティブ GPU コンピューティング能力が完全に解放されます。

つまり、WEKA のメモリ拡張ソフトウェアは、クラウド プラットフォームがより多くのユーザーにサービスを提供し、より多くのトークンを処理し、運用コストを効果的に削減するのに役立ちます。

WEKAのCEOであるLiran Zvibel氏は、「推論パフォーマンスは、利用可能なGPUの有効メモリによってボトルネックになっている。これらの結果は、ハードウェアのアップグレードだけではAIトークンの経済的問題を解決できないことを証明している。本当の限界は、GPUパフォーマンスを抑制する長年のメモリの壁である。OCIに関するWEKAのソリューションは、最適化された総所有コストによってトークン処理能力を大幅に向上させる。」と述べた。

OCI は、完全なベンチマーク手法、システム構成、および完全なテスト結果を公式 AI & データ サイエンス ブログで公開しています。

Augmented Memory Grid を備えた NeuralMesh は現在、WEKA の顧客向けに一般提供されており、OCI が独占的なクラウド立ち上げパートナーとして機能し、Oracle Marketplace に上場されています。 OCIでロングコンテキスト推論を実行している企業は、この完全に検証された本番環境に対応したアーキテクチャをすぐにデプロイできます。

北京乾興解放科技有限公司
サンディ・ヤン/グローバル戦略ディレクター
WhatsApp / WeChat: +86 13426366826
電子メール: yangyd@qianxingdata.com
ウェブサイト: www.qianxingdata.com/www.storagesserver.com
ビジネスの焦点:
ICTプロダクト流通/システムインテグレーション&サービス/インフラソリューション
20 年以上の IT 流通経験を持つ当社は、主要な世界的ブランドと提携して、信頼性の高い製品とプロフェッショナルなサービスを提供しています。
「テクノロジーを活用してインテリジェントな世界を構築する」信頼できる ICT 製品サービス プロバイダー!
パブの時間 : 2026-06-12 10:54:05 >> ニュースのリスト
連絡先の詳細
Beijing Qianxing Jietong Technology Co., Ltd.

コンタクトパーソン: Ms. Sandy Yang

電話番号: 13426366826

私達に直接お問い合わせを送信 (0 / 3000)