Ir al contenido principal

Modelo de Fundación Servicio

Sirva modelos fundacionales de última generación para las necesidades de cargas de trabajo de inferencia tanto en tiempo real como por lotes. Esto le permite crear aplicaciones de forma rápida y sencilla que aprovechan modelos de IA generativa de alta calidad sin la necesidad de mantener su propia implementación de modelos.

Loading...

* Los precios mostrados no garantizan la disponibilidad del producto en esa región. Para la disponibilidad de productos, consulta aquí: AWS, Azure, GCP, SAP
1. Azure Databricks, como servicio de primera mano en Microsoft Azure, ofrece facturación unificada y soporte por parte de Microsoft
   El nivel Premium en Azure Databricks corresponde al nivel Enterprise en AWS y GCP
2. Se cobra por hora con un incremento por minuto
3. El rendimiento en una sola unidad de capacidad de PT varía según el modelo y la forma de consulta (tokens de entrada vs. salida). Por favor, emplea la calculadora GenAI para estimar el rendimiento específico de la carga de trabajo y el costo total

Modelo Fundación que sirve a las tasas de DBU

ModeloPago por tokenRendimiento aprovisionado
DBU/M de tokens
de entrada
DBU / M de tokens
de salida
DBU por hora
(capacidad de entrada)
DBU / hora
(capacidad de escalado)
Llama 4 Maverick7.14321.42985.71485.714
Llama 3.3 70B7.14321.42985.714342.857
Qwen 3 Next 80B2.14317.14378.57178.571
Qwen 3.5 122B3.14331.42985.71485.714
GPT OSS 120B2.1438.57171.42971.429
Gemma 3 12B2.1437.14371.42971.429
Llama 3.1 8B2.1436.42953.571106.000
GPT OSS 20B1.0004.28653.57153.571
Llama 3.2 3Bn/an/a46.42992.857
Llama 3.2 1Bn/an/a42.85785.714
Qwen 3 0.6B Embedding0.286n/a25.00025.000
GTE1.857n/a20.00020.000
BGE Grande1.429n/a24.00024.000

1: La capacidad de entrada es la unidad de capacidad de PT pequeña y de menor costo, diseñada para ofrecer un punto de partida más asequible para los clientes. Estas proporcionan un rendimiento reducido proporcionalmente en comparación con la capacidad de escalamiento. Solo están disponibles en Azure y AWS para las regiones de EE. UU., Canadá y Brasil, y solo para modelos base (no ajustados).

2: La capacidad de escalabilidad es el incremento estándar de capacidad PT que puede aprovisionar para un modelo. Más allá de la capacidad de entrada (disponible en nubes y regiones seleccionadas), la capacidad de Débito Provisionado escala hacia arriba y hacia abajo en incrementos de estas unidades de capacidad escalable. En nubes o regiones donde la capacidad de entrada no está disponible, el incremento mínimo de compra de PT es la unidad de capacidad de escalabilidad completa.

Pago por uso con una prueba gratuita de 14 días o contáctenos para obtener descuentos por uso comprometido o requisitos personalizados.

Preguntas frecuentes sobre el servicio de modelos fundacionales