Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione alla scalabilità di Ollama
- Architettura di Ollama e considerazioni sulla scalabilità
- Collo di bottiglia comuni nelle implementazioni multi-utente
- Best practice per la prontezza dell'infrastruttura
Allocazione delle risorse e ottimizzazione GPU
- Strategie per l'utilizzo efficiente di CPU/GPU
- Considerazioni su memoria e banda
- Limitazioni delle risorse a livello di contenitore
Deployment con contenitori e Kubernetes
- Containerizzazione di Ollama con Docker
- Esecuzione di Ollama in cluster Kubernetes
- Bilanciamento del carico e rilevamento dei servizi
Autoscaling e Batching
- Progettazione di policy di autoscaling per Ollama
- Tecniche di inferenza batch per l'ottimizzazione del throughput
- Compromessi tra latenza e throughput
Ottimizzazione della latenza
- Profiling delle prestazioni di inferenza
- Strategie di caching e warm-up del modello
- Riduzione dell'overhead di I/O e comunicazione
Monitoraggio e osservabilità
- Integrazione di Prometheus per le metriche
- Creazione di dashboard con Grafana
- Allertamento e risposta agli incidenti per l'infrastruttura Ollama
Gestione dei costi e strategie di scalabilità
- Allocazione GPU consapevole dei costi
- Considerazioni sul deployment cloud vs on-premise
- Strategie per una scalabilità sostenibile
Riepilogo e prossimi passi
Requisiti
- Esperienza nell'amministrazione dei sistemi Linux
- Comprensione della containerizzazione e dell'orchestrazione
- Familiarità con il deployment dei modelli di machine learning
Pubblico di riferimento
- Ingegneri DevOps
- Team di infrastruttura ML
- Ingegneri per l'affidabilità dei siti (SRE)
21 ore