メインコンテンツへジャンプ

基盤モデルサービング

リアルタイムおよびバッチ推論ワークロードのニーズに対応する、最先端のオープン基盤モデルを提供します。これにより、独自のモデル展開を維持することなく、高品質な生成 AI モデルを活用したアプリケーションを迅速かつ容易に構築できます。

Loading...

* 表示されている価格は、そのリージョンでの製品の提供を保証するものではありません。製品の提供状況については、こちらをご覧ください: AWSAzureGCPSAP
1. Azure Databricks は Microsoft Azure のファーストパーティ サービスとして、Microsoft による一元的な請求とサポートを提供します
   Azure Databricks の Premium ティアは、AWS および GCP の Enterprise ティアに相当します
2. 時間単位の料金は、分単位で課金されます
3. 単一ユニットの PT 容量の throughput は、モデルとクエリーの形式 (入力トークンと出力トークン) によって異なります。ワークロード固有のthroughputと総費用の見積もりには、GenAI Calculator をご利用ください。

基盤モデルサービングのDBU料金

モデルトークン単位の従量課金プロビジョニング済みスループット
DBU / 100万入力
トークン
DBU / 100万出力
トークン
DBU / 時間
(エントリー容量)
DBU / 時間
(スケーリング容量)
Llama 4 Maverick7.14321.42985.71485.714
Llama 3.3 70B7.14321.42985.714342.857
Qwen 3 Next 80B2.14317.14378.57178.571
Qwen 3.5 122B3.14331.42985.71485.714
GPT OSS 120B2.1438.57171.42971.429
Gemma 3 12B2.1437.14371.42971.429
Llama 3.1 8B2.1436.42953.571106.000
GPT OSS 20B1.0004.28653.57153.571
Llama 3.2 3BN/AN/A46.42992.857
Llama 3.2 1BN/AN/A42.85785.714
Qwen 3 0.6B エンベディング0.286N/A25.00025.000
GTE1.857N/A20.00020.000
BGE Large1.429N/A24.00024.000

1: エントリーキャパシティは、顧客がより手頃な価格で始められるように設計された、小規模で低コストの PT キャパシティ ユニットです。これらはスケーリング容量と比較して、throughputが比例的に低下します。これらは、Azure および AWS の米国、カナダ、ブラジルのリージョンで、ベースモデル(ファインチューニングされていないモデル)にのみご利用いただけます。

2: スケーリング キャパシティとは、モデルにプロビジョニングできる、標準の PT キャパシティ増分のことです。エントリ容量(一部のクラウドとリージョンで利用可能)を超えると、プロビジョニングされたThroughput容量は、これらのスケーリング容量ユニット単位でスケールアップおよびスケールダウンします。エントリ容量が利用できないクラウド / リージョンでは、PT の最小購入単位は、スケーリング容量ユニット 1 つ分となります。

従量課金制のプランを 14 日間無料でお試しいただけます。コミットに応じた割引価格および、カスタム要件もご用意しております。

基盤モデルサービング