Contattataci

Struttura del corso

Introduzione alla scalabilità di Ollama

  • Architettura di Ollama e considerazioni sulla scalabilità
  • Collo di bottiglia comuni nelle implementazioni multi-utente
  • Best practice per la prontezza dell'infrastruttura

Allocazione delle risorse e ottimizzazione GPU

  • Strategie per l'utilizzo efficiente di CPU/GPU
  • Considerazioni su memoria e banda
  • Limitazioni delle risorse a livello di contenitore

Deployment con contenitori e Kubernetes

  • Containerizzazione di Ollama con Docker
  • Esecuzione di Ollama in cluster Kubernetes
  • Bilanciamento del carico e rilevamento dei servizi

Autoscaling e Batching

  • Progettazione di policy di autoscaling per Ollama
  • Tecniche di inferenza batch per l'ottimizzazione del throughput
  • Compromessi tra latenza e throughput

Ottimizzazione della latenza

  • Profiling delle prestazioni di inferenza
  • Strategie di caching e warm-up del modello
  • Riduzione dell'overhead di I/O e comunicazione

Monitoraggio e osservabilità

  • Integrazione di Prometheus per le metriche
  • Creazione di dashboard con Grafana
  • Allertamento e risposta agli incidenti per l'infrastruttura Ollama

Gestione dei costi e strategie di scalabilità

  • Allocazione GPU consapevole dei costi
  • Considerazioni sul deployment cloud vs on-premise
  • Strategie per una scalabilità sostenibile

Riepilogo e prossimi passi

Requisiti

  • Esperienza nell'amministrazione dei sistemi Linux
  • Comprensione della containerizzazione e dell'orchestrazione
  • Familiarità con il deployment dei modelli di machine learning

Pubblico di riferimento

  • Ingegneri DevOps
  • Team di infrastruttura ML
  • Ingegneri per l'affidabilità dei siti (SRE)
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative