Saltar al contenido principal
JLT NetworksMiami, FL · USA

Servidores para IA: GPU, alimentación y densidad por rack

Nodos de inferencia y entrenamiento dimensionados por VRAM, potencia y refrigeración reales del sitio, exportados desde Miami hacia data centers y operadores de Latinoamérica.

  • Empresa en Miami, Florida
  • Exportamos a toda Latinoamérica
  • Equipos nuevos y refurbished certificados
  • Garantía y soporte técnico
  • Atención en español e inglés
  • Cotizaciones rápidas

La primera decisión no es la marca del acelerador sino si el nodo va a servir inferencia o a entrenar. Entrenar está limitado por el ancho de banda entre GPU y por la memoria agregada: escala a varios nodos y exige interconexión dedicada con RDMA, porque en cuanto la red se vuelve el cuello de botella las GPU pasan el tiempo esperando datos. La inferencia está limitada por la capacidad de memoria para alojar los pesos y por la latencia por petición, y muchas veces corre bien en nodos de una o dos GPU. Comprar un nodo de entrenamiento para servir inferencia desperdicia capital y, sobre todo, potencia eléctrica.

La memoria se calcula, no se estima. Los pesos ocupan el número de parámetros multiplicado por los bytes de cada uno: un modelo de 70.000 millones de parámetros en precisión de 16 bits necesita del orden de 140 GB solo para pesos, unos 70 GB cuantizado a 8 bits y cerca de 35 GB a 4 bits. A eso se suma la caché de contexto, que crece con la longitud de la ventana y con el número de peticiones concurrentes, y que es lo que realmente decide cuántos usuarios simultáneos soporta el nodo. Primero se fija la VRAM agregada necesaria; recién después se elige acelerador e interconexión.

El punto donde más proyectos se frenan en la región no es el precio del acelerador sino la instalación. Un nodo con ocho aceleradores de gama alta puede demandar entre 6 y 10 kW, mientras que un rack de colocation regional suele estar aprovisionado entre 3 y 8 kW. Antes de emitir la orden hay que confirmar tres cosas con el data center: potencia contratada por rack, tipo de circuito y capacidad de las PDU, y si la sala disipa por aire con pasillo confinado o admite puertas traseras con intercambiador de calor. La densidad por rack, y no el presupuesto, es la restricción que manda.

El resto del nodo se dimensiona en función de las GPU y no al revés. Cada acelerador quiere sus carriles PCIe completos, así que conviene revisar cuántas ranuras x16 electrónicas ofrece realmente el chasis antes de contar ranuras físicas. En entrenamiento, la lectura del conjunto de datos es aleatoria y un almacenamiento lento deja las GPU ociosas: NVMe local para preparación y staging, no un arreglo compartido por red pensado para respaldos. En red, 100G por nodo es lo razonable para entrenamiento distribuido, mientras que 25G suele bastar para servir inferencia en producción.

La forma sensata de entrar es por etapas: un nodo de inferencia en producción, medición real de utilización durante algunas semanas y crecimiento sobre datos propios en lugar de sobre una proyección. Chile es hoy la plaza donde esto se ve con más claridad, con Santiago consolidado como mercado de data centers regionales y un patrón de gasto orientado a capacidad y densificación más que a cobertura nueva. Para las piezas que no son acelerador —nodos de cabecera, almacenamiento de datos y red de clúster— el equipo refurbished certificado baja el costo total sin tocar el rendimiento de la carga.

Criterios de selección

Lo que realmente decide la compra. Envíe estos datos en su solicitud y la cotización sale dimensionada.

Entrenamiento o inferencia
Entrenar escala por interconexión y memoria agregada; inferir escala por VRAM por nodo y latencia por petición.
VRAM agregada requerida
Parámetros por bytes de precisión más caché de contexto: 70.000 millones en 16 bits piden unos 140 GB.
Potencia por rack
Un nodo denso puede pedir de 6 a 10 kW; confirme la potencia contratada del rack antes de comprar el equipo.
Refrigeración del sitio
El aire con pasillo confinado tiene techo práctico; por encima hay que evaluar puerta trasera con intercambiador o líquido.
Carriles PCIe por acelerador
Cuente ranuras x16 electrónicas y no ranuras físicas: ahí se pierde rendimiento sin que aparezca en la factura.
Almacenamiento y red por nodo
NVMe local para staging de datos; 100G por nodo en entrenamiento distribuido y 25G suele bastar en inferencia.

Escenarios típicos en Latinoamérica

Servir inferencia de un modelo propio

El criterio es VRAM suficiente para los pesos más la caché de contexto de las peticiones concurrentes. Un nodo bien dimensionado de una o dos GPU rinde más que un clúster mal utilizado y consume una fracción de la potencia eléctrica.

Ampliar un clúster de entrenamiento existente

Sumar nodos idénticos al clúster actual y verificar que la red de interconexión crece con ellos. Si el fabric no escala, cada nodo adicional aporta menos que el anterior y la utilización promedio de GPU cae.

Infraestructura de soporte del clúster

Nodos de cabecera, almacenamiento de conjuntos de datos y switching de clúster representan buena parte del BOM y no exigen equipo de última generación: es donde el refurbished certificado ahorra sin costo de rendimiento.

Equipos para esta solución

Envíe el part number y le confirmamos disponibilidad, condición y tiempo de entrega.

Equipos para esta solución
EquipoCotizar
Dell PowerEdge R730R730Chasis de 2U con espacio y alimentación para aceleradores de doble ancho: punto de entrada habitual para un primer nodo de inferencia en producción.Ficha técnicaCotizar
Dell PowerEdge R630R630Nodo de cabecera y de servicios del clúster —planificador de trabajos, gestión y APIs— donde no hace falta ocupar tiempo de acelerador.Ficha técnicaCotizar
HPE ProLiant DL180 Gen9DL180Nodo de almacenamiento de conjuntos de datos con muchas bahías, pensado para que las GPU no queden esperando lectura durante el entrenamiento.Ficha técnicaCotizar
HPE ProLiant DL160 Gen9DL160Cómputo general denso para preprocesamiento, limpieza y etiquetado de datos, tareas que no justifican consumir horas de GPU.Ficha técnicaCotizar
HPE ApolloApolloLínea de cómputo denso para proyectos de HPC y aceleración donde el criterio de compra pasa a ser densidad por rack y disipación del sitio.Cotizar
Juniper QFX5100QFX5100Hoja de la red del clúster: agrega los nodos con baja latencia y tiene una disponibilidad excelente en el mercado refurbished certificado.Ficha técnicaCotizar

¿No aparece su modelo? Envíe el part number exacto — también trabajamos equipos descontinuados y difíciles de conseguir.

Preguntas frecuentes

Lo que preguntan los equipos técnicos antes de comprar.

¿Cómo sé cuánta VRAM necesito?

Multiplique parámetros por bytes de precisión y sume la caché de contexto de las peticiones concurrentes previstas. Un modelo de 70.000 millones de parámetros en 16 bits pide unos 140 GB solo de pesos; cuantizarlo a 8 o 4 bits reduce esa cifra a la mitad o a la cuarta parte, con impacto en calidad que conviene medir.

¿Cotizan el nodo completo o solo el chasis?

El nodo completo: procesadores, memoria, aceleradores, almacenamiento, tarjetas de red y fuentes. No publicamos precios porque la configuración cambia el costo mucho más que el modelo de chasis. Indique la carga prevista y el modelo que va a ejecutar y la cotización se arma sobre esa base.

¿Pueden enviar servidores de IA a Chile o Colombia?

Sí, se exportan desde Miami. Para Santiago la carga aérea suele ser la opción cuando el proyecto tiene fecha, ya que el tránsito marítimo pasa por el Canal de Panamá y es el más largo de los mercados que atendemos. Antes del envío conviene validar tensión, tipo de circuito y capacidad de PDU del sitio de destino.

¿Sirve equipo refurbished certificado para cargas de IA?

Depende de la capa. Para nodos de cabecera, almacenamiento de datos y red de clúster es donde más ahorro genera sin afectar el rendimiento de la carga. Para el nodo acelerador, la decisión pasa por la generación disponible y por la compatibilidad de alimentación y refrigeración, que se valida antes de cotizar.

Exportamos desde Miami a toda Latinoamérica

Cotizar: Servidores para IA: GPU, alimentación y densidad por rack

Envíe un part number o una lista completa de materiales. Le confirmamos disponibilidad, condición y tiempo de entrega.

  • Empresa en Miami, Florida
  • Exportamos a toda Latinoamérica
  • Equipos nuevos y refurbished certificados
  • Garantía y soporte técnico
  • Atención en español e inglés
  • Cotizaciones rápidas
Cotizando
Servidores para IA: GPU, alimentación y densidad por rack
Hablar por WhatsApp

Sin registro ni contraseña. Solo nombre y correo. · Respuesta habitual en un día hábil

Marcas para esta solución