Contattataci

Struttura del corso

Sovranità AI e deployment locale dei LLM

  • Rischi dei LLM cloud: conservazione dei dati, training sugli input, giurisdizione straniera.
  • Architettura di Ollama: server del modello, registro e API compatibile con OpenAI.
  • Confronto con vLLM, llama.cpp e Text Generation Inference.
  • Licensing dei modelli: termini di Llama, Mistral, Qwen e Gemma.

Installazione e configurazione hardware

  • Installazione di Ollama su Linux con supporto CUDA e ROCm.
  • Opzione di fallback solo CPU e ottimizzazione AVX/AVX2.
  • Distribuzione tramite Docker e mappatura dei volumi persistenti.
  • Configurazione multi-GPU e strategie di allocazione VRAM.

Gestione dei modelli

  • Scaricamento dei modelli dal registro Ollama: ollama pull llama3.
  • Importazione di modelli GGUF da HuggingFace e TheBloke.
  • Livelli di quantizzazione: compromessi tra Q4_K_M, Q5_K_M e Q8_0.
  • Cambio di modello e limiti di caricamento concorrente dei modelli.

Modelfile personalizzati

  • Sintassi della scrittura del Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Tuning di temperatura, top_p e repeat_penalty.
  • Ingegnerizzazione dei prompt di sistema per comportamenti specifici al ruolo.
  • Creazione e pubblicazione di modelli personalizzati nel registro locale.

Integrazione API

  • Endpoint /v1/chat/completions compatibile con OpenAI.
  • Risposte in streaming e modalità JSON.
  • Integrazione con LangChain, LlamaIndex e applicazioni personalizzate.
  • Autenticazione e limitazione del traffico tramite reverse proxy.

Ottimizzazione delle prestazioni

  • Dimensionamento della finestra di contesto e gestione della cache KV.
  • Inferenza batch e gestione delle richieste parallele.
  • Allocazione dei thread CPU e consapevolezza NUMA.
  • Monitoraggio dell'utilizzo delle GPU e della pressione della memoria.

Sicurezza e conformità

  • Isolamento di rete per gli endpoint di servizio dei modelli.
  • Pipeline di filtraggio degli input e moderazione degli output.
  • Registrazione audit dei prompt e dei completamenti.
  • Provenienza del modello e verifica dell'hash.

Requisiti

  • Conoscenze intermedie di amministrazione Linux e dei container.
  • Comprensione ad alto livello del machine learning e dei modelli transformer.
  • Familiarità con le API REST e JSON.

Pubblico

  • Ingegneri AI e sviluppatori che rimpiazzano le API cloud dei LLM.
  • Organizzazioni con sensibilità dati che impediscono l'uso di modelli cloud.
  • Team governativi e della difesa che richiedono modelli linguistici air-gapped.
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative