Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Sovranità AI e deployment locale dei LLM
- Rischi dei LLM cloud: conservazione dei dati, training sugli input, giurisdizione straniera.
- Architettura di Ollama: server del modello, registro e API compatibile con OpenAI.
- Confronto con vLLM, llama.cpp e Text Generation Inference.
- Licensing dei modelli: termini di Llama, Mistral, Qwen e Gemma.
Installazione e configurazione hardware
- Installazione di Ollama su Linux con supporto CUDA e ROCm.
- Opzione di fallback solo CPU e ottimizzazione AVX/AVX2.
- Distribuzione tramite Docker e mappatura dei volumi persistenti.
- Configurazione multi-GPU e strategie di allocazione VRAM.
Gestione dei modelli
- Scaricamento dei modelli dal registro Ollama: ollama pull llama3.
- Importazione di modelli GGUF da HuggingFace e TheBloke.
- Livelli di quantizzazione: compromessi tra Q4_K_M, Q5_K_M e Q8_0.
- Cambio di modello e limiti di caricamento concorrente dei modelli.
Modelfile personalizzati
- Sintassi della scrittura del Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Tuning di temperatura, top_p e repeat_penalty.
- Ingegnerizzazione dei prompt di sistema per comportamenti specifici al ruolo.
- Creazione e pubblicazione di modelli personalizzati nel registro locale.
Integrazione API
- Endpoint /v1/chat/completions compatibile con OpenAI.
- Risposte in streaming e modalità JSON.
- Integrazione con LangChain, LlamaIndex e applicazioni personalizzate.
- Autenticazione e limitazione del traffico tramite reverse proxy.
Ottimizzazione delle prestazioni
- Dimensionamento della finestra di contesto e gestione della cache KV.
- Inferenza batch e gestione delle richieste parallele.
- Allocazione dei thread CPU e consapevolezza NUMA.
- Monitoraggio dell'utilizzo delle GPU e della pressione della memoria.
Sicurezza e conformità
- Isolamento di rete per gli endpoint di servizio dei modelli.
- Pipeline di filtraggio degli input e moderazione degli output.
- Registrazione audit dei prompt e dei completamenti.
- Provenienza del modello e verifica dell'hash.
Requisiti
- Conoscenze intermedie di amministrazione Linux e dei container.
- Comprensione ad alto livello del machine learning e dei modelli transformer.
- Familiarità con le API REST e JSON.
Pubblico
- Ingegneri AI e sviluppatori che rimpiazzano le API cloud dei LLM.
- Organizzazioni con sensibilità dati che impediscono l'uso di modelli cloud.
- Team governativi e della difesa che richiedono modelli linguistici air-gapped.
14 ore