Základní info
Technický kurz se věnuje provozu open-weight jazykových modelů ve vlastní infrastruktuře a rozhodnutí, kdy self-hosting dává smysl.
Cílová skupina
- Backend vývojáři.
- DevOps a platformní inženýři.
- Tech leadeři a architekti.
- Organizace řešící soukromí dat a pokročilí uživatelé LLM API.
Cíle kurzu
- Vybrat model a vhodný inference stack.
- Odhadnout nároky na hardware a VRAM.
- Rozumět kvantizaci, licencím a provozním kompromisům.
- Navrhnout self-hosted RAG a bezpečný provoz.
Osnova kurzu
- Open-weight modely a licence.
- Hardware, VRAM a kvantizace.
- Ollama, llama.cpp a vLLM.
- Inference, API a správa modelů.
- Embeddings a self-hosted RAG.
- Základy LoRA/fine-tuningu.
- Bezpečnost, monitoring a provozní omezení.
Předpoklady účastníka
- Linuxová příkazová řádka.
- Základy Pythonu a Dockeru.
- Zkušenost s LLM API je výhodou.
Technické / další požadavky
- Notebook s internetem, SSH, Docker, Python 3.11 a editor/IDE.