Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Durata 14 ore
Struttura del corso
Fondamenti della distribuzione di Tencent Hunyuan in produzione
- Panoramica sugli scenari di implementazione dei modelli Tencent Hunyuan;
- Caratteristiche produttive dei modelli di grandi dimensioni e MoE;
- Problematiche comuni riguardanti latenza, throughput e costi;
- Definizione degli obiettivi operativi per i carichi di lavoro legati all’inferenza.
Architettura di distribuzione e flusso di inferenza
- Componenti chiave di uno stack produttivo per l’inferenza;
- Scelta tra modelli di distribuzione containerizzati, on-premise o basati su cloud;
- Nozioni di base sul caricamento dei modelli, instradamento delle richieste e allocazione della GPU;
- Principi per garantire affidabilità e semplicità operativa.
Ottimizzazione della latenza nella pratica
- Utilizzo di motori di inferenza ottimizzati come TensorRT, ove applicabile;
- Concetti legati alla cache KV e tecniche pratiche per la sua regolazione;
- Riduzione dei tempi di avvio, riscaldamento e latenza nelle risposte;
- Misurazione del tempo impiegato per il primo token emesso e della velocità di generazione dei token.
Throughput, batching ed efficienza GPU
- Strategie di batching continuo e gestione aggregata delle richieste;
- Gestione della concorrenza e del comportamento delle code;
- Aumento dell’utilizzo delle GPU senza compromettere l’esperienza utente;
- Gestione di richieste a contesto lungo o di carichi di lavoro eterogenei.
Quantizzazione e controllo dei costi
- Ragioni per cui la quantizzazione è fondamentale nella distribuzione in produzione;
- Considerazioni pratiche legate all’uso di precisioni come FP16 e INT8;
- Bilanciamento tra qualità del modello, latenza e costi infrastrutturali;
- Creazione di una semplice checklist per l’ottimizzazione dei costi.
Operazioni, monitoraggio e valutazione dello stato operativo
- Trigger per attivare l’autoscaling nei servizi di inferenza;
- Monitoraggio della latenza, del throughput, dell’utilizzo della cache e della salute delle GPU;
- Nozioni base su logging, alerting e gestione degli incidenti;
- Analisi di un esempio reale di distribuzione e creazione di un piano d’ottimizzazione.
Requisiti
- Conoscenza di base riguardo alla distribuzione e all’inferenza dei modelli linguistici di grandi dimensioni;
- Esperienza nell’utilizzo di container, infrastrutture cloud o on-premise e servizi basati su API;
- Competenze pratiche in Python o nelle attività tipiche dell’ingegneria dei sistemi.
Destinatari del corso
- Ingegneri ML responsabili della distribuzione di modelli linguistici in produzione;
- Ingegneri platform impegnati nella gestione di servizi di inferenza basati su GPU;
- Architetti che progettano piattaforme scalabili per la distribuzione di intelligenza artificiale.