Contattataci

Struttura del corso

Introduzione a EXO e al clustering AI locale

  • Panoramica del framework EXO e dell'ecosistema exo-explore
  • Confronto tra inferenza centralizzata su cloud e inferenza locale distribuita
  • Architettura: rilevamento dispositivi libp2p, backend MLX, dashboard e strati API
  • Requisiti hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, storage condiviso

Installazione di EXO su macOS

  • Configurazione di Xcode, Metal Toolchain e prerequisiti macOS
  • Installazione di uv, Node.js e toolchain Rust nightly
  • Installazione del fork macmon pinned per il monitoraggio Apple Silicon
  • Clonazione del repository e compilazione della dashboard con npm
  • Esecuzione di EXO dal sorgente e verifica della dashboard su localhost:52415

Installazione di EXO su Linux

  • Installazione delle dipendenze tramite apt o Homebrew su Linux
  • Configurazione di uv, Node.js 18+ e Rust nightly
  • Compilazione della dashboard ed esecuzione di EXO in modalità solo CPU
  • Struttura delle directory: percorsi XDG Base Directory per config, data, cache e logs

Rilevamento automatico dei dispositivi e formazione del cluster

  • Comprensione del rilevamento automatico basato su libp2p nelle reti locali
  • Configurazione di namespace personalizzati con EXO_LIBP2P_NAMESPACE per l'isolamento del cluster
  • Verifica dell'appartenenza dei nodi nella vista cluster della dashboard
  • Gestione dei fallimenti del rilevamento e problemi di segmentazione di rete

Abilitazione di RDMA su Thunderbolt 5

  • Architettura RDMA e la claims di riduzione della latenza del 99 percento
  • Attivazione di RDMA in modalità Recovery macOS con rdma_ctl
  • Requisiti dei cavi e vincoli della topologia delle porte su Mac Studio
  • Allineamento delle versioni macOS tra tutti i nodi del cluster
  • Risoluzione problemi di rilevamento RDMA e configurazione DHCP

Implementazione di Modelli All'Avanguardia

  • Utilizzo della dashboard per caricare e frammentare i modelli DeepSeek v3.1, Qwen3-235B e famiglia Llama
  • Anteprima delle posizioni delle istanze con l'endpoint API /instance/previews
  • Creazione di istanze dei modelli con frammentazione a pipeline o parallelo sui tensori
  • Configurazione di schede modello personalizzate da HuggingFace hub

Monitoraggio e Troubleshooting

  • Lettura dei log EXO e comprensione del distributed tracing
  • Interpretazione della salute del cluster nella vista cluster della dashboard
  • Diagnosi dei guasti dei nodi worker e comportamento di riconnessione
  • Utilizzo di EXO_TRACING_ENABLED per l'analisi dei colli di bottiglia delle prestazioni

Mantenimento e Aggiornamenti del Cluster

  • Aggiornamento dei binari EXO e procedure di ricostruzione della dashboard
  • Migrazione delle cache dei modelli e gestione dei modelli prescaricati su NFS
  • Rimozione ordinata dei nodi e bilanciamento del carico di lavoro

Requisiti

  • Conoscenza dei fondamenti delle reti (IP, subnetting, firewall)
  • Esperienza con l'amministrazione della riga di comando su macOS o Linux
  • Confidenza con la gestione dei pacchetti Python (pip/uv) e gli strumenti Node.js

Audiencia

  • Amministratori di sistema
  • Ingegneri DevOps
  • Architetti di infrastrutture AI responsabili dell'implementazione LLM on-premise
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative