Contattataci

Struttura del corso

Fondamenti della distribuzione di Tencent Hunyuan in produzione

  • Panoramica sugli scenari di implementazione dei modelli Tencent Hunyuan;
  • Caratteristiche produttive dei modelli di grandi dimensioni e MoE;
  • Problematiche comuni riguardanti latenza, throughput e costi;
  • Definizione degli obiettivi operativi per i carichi di lavoro legati all’inferenza.

Architettura di distribuzione e flusso di inferenza

  • Componenti chiave di uno stack produttivo per l’inferenza;
  • Scelta tra modelli di distribuzione containerizzati, on-premise o basati su cloud;
  • Nozioni di base sul caricamento dei modelli, instradamento delle richieste e allocazione della GPU;
  • Principi per garantire affidabilità e semplicità operativa.

Ottimizzazione della latenza nella pratica

  • Utilizzo di motori di inferenza ottimizzati come TensorRT, ove applicabile;
  • Concetti legati alla cache KV e tecniche pratiche per la sua regolazione;
  • Riduzione dei tempi di avvio, riscaldamento e latenza nelle risposte;
  • Misurazione del tempo impiegato per il primo token emesso e della velocità di generazione dei token.

Throughput, batching ed efficienza GPU

  • Strategie di batching continuo e gestione aggregata delle richieste;
  • Gestione della concorrenza e del comportamento delle code;
  • Aumento dell’utilizzo delle GPU senza compromettere l’esperienza utente;
  • Gestione di richieste a contesto lungo o di carichi di lavoro eterogenei.

Quantizzazione e controllo dei costi

  • Ragioni per cui la quantizzazione è fondamentale nella distribuzione in produzione;
  • Considerazioni pratiche legate all’uso di precisioni come FP16 e INT8;
  • Bilanciamento tra qualità del modello, latenza e costi infrastrutturali;
  • Creazione di una semplice checklist per l’ottimizzazione dei costi.

Operazioni, monitoraggio e valutazione dello stato operativo

  • Trigger per attivare l’autoscaling nei servizi di inferenza;
  • Monitoraggio della latenza, del throughput, dell’utilizzo della cache e della salute delle GPU;
  • Nozioni base su logging, alerting e gestione degli incidenti;
  • Analisi di un esempio reale di distribuzione e creazione di un piano d’ottimizzazione.
}

Requisiti

  • Conoscenza di base riguardo alla distribuzione e all’inferenza dei modelli linguistici di grandi dimensioni;
  • Esperienza nell’utilizzo di container, infrastrutture cloud o on-premise e servizi basati su API;
  • Competenze pratiche in Python o nelle attività tipiche dell’ingegneria dei sistemi.

Destinatari del corso

  • Ingegneri ML responsabili della distribuzione di modelli linguistici in produzione;
  • Ingegneri platform impegnati nella gestione di servizi di inferenza basati su GPU;
  • Architetti che progettano piattaforme scalabili per la distribuzione di intelligenza artificiale.
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative