← Zpět do Warpy AI labu
Warpy Lab / Veřejný recept / X11c

Tři DGX Sparks.
DeepSeek vyladěný pro dlouhý kontext.

Vlastní TP3 recept pro DeepSeek V4.1 Flash. Dlouhá zadání, opakované využití prefix cache a MAX reasoning. Tak, jak lokální AI používáme každý den s Hermes Agentem.

Přehled receptu X11c: tři DGX Sparks, TP3, sdílená KV cache 3,3 milionu tokenů a maximální kontext 401 tisíc tokenů
3,3Mtokenů

Sdílená KV cache

Naměřená kapacita pro opakované využití kontextu napříč požadavky.

401Ktokenů

Maximální kontext

Až 401 408 tokenů v jednom požadavku, včetně generované odpovědi.

154tok/s

Souhrnný výstup při C8

154,38 tok/s celkem při osmi souběžných požadavcích, včetně čekání na první token.

1,47Ktok/s

Zpracování vstupu 64K

1 467,88 tok/s při zpracování dlouhého vstupu bez již zahřáté cache.

Měření konfigurace X11c v režimu MAX reasoning. Kapacita KV cache je sdílená mezi požadavky; maximální kontext zahrnuje vstup i odpověď. Údaj C8 vyjadřuje souhrnný výkon osmi požadavků.

Optimalizace podle skutečné práce

Agent potřebuje víc než rychlou krátkou odpověď.

Recept jsme začali ladit, protože jiné konfigurace neodpovídaly našemu způsobu práce. Prioritou byl dlouhý kontext, velké vstupy, opakované využití cache a přemýšlení v režimu MAX. Výsledkem je nastavení, které používáme v našem agentním provozu.

01 / Z provozu

Dlouhé zadání. Plný kontext.

Agent pracuje s rozsáhlými podklady, historií úkolu a výsledky nástrojů. Proto ladíme zpracování dlouhých vstupů i kapacitu kontextu pro pokračující práci.

02 / Z provozu

Kontext, který využijete znovu.

Opakované části zadání patří do prefix cache. Konfiguraci jsme ladili pro práci, kde se agent vrací ke stejnému základu a přidává nové kroky, místo aby pokaždé začínal od nuly.

03 / Z provozu

Reasoning pro každodenní úkoly.

Hlavní Hermes Agent běží v režimu MAX reasoning. Recept vznikal při skutečné agentní práci s nástroji a souběžnými požadavky, které potřebují prostor i průběžný kontext.

Uvnitř receptu

Konfigurace X11c.

Tři stroje spolu zpracovávají model pomocí tensor parallelismu. Recept propojuje inference engine, kvantizované váhy, cache a spekulativní dekódování do ověřené sestavy.

Hardware
3× NVIDIA DGX Spark
Paralelismus
TP3 · pipeline parallelism 1
Inference engine
vLLM + EXL3 CUDA plugin
Kvantizace expertů
EXL3 · přibližně 3,51 bpw
KV cache
FP8 · bloky po 128 tokenech
Spekulativní dekódování
DSpark · draft K5
Zpracování vstupu
Prefill bloky po 4 096 tokenech
Hlavní agent
Hermes · MAX reasoning
Naměřeno v naší laboratoři

Výsledky, které mají kontext.

X11c / základní běh MAX reasoning
MěřeníVýsledek
C1: dekódování jednoho požadavku67,50 tok/s
C3: dekódování na požadavek32,12 tok/s
C8: souhrnný výstup154,38 tok/s
64K: studený prefill1 467,88 tok/s

C1 a C3 měří dekódování na požadavek. C8 měří celkový výstup vůči době běhu skupiny, včetně latence prvního tokenu. Tyto hodnoty nelze přímo porovnávat jako jednu křivku škálování.

Jde o jednotlivé běhy v konkrétním prostředí. Testy 128K při C3 narazily na časový limit a neposkytly dokončený výsledek. Metodika, další běhy i omezení jsou dostupné v repozitáři.

Stejný přístup pro vaše zadání

Co má vaše lokální AI zvládnout?

Pomůžeme s nasazením a optimalizací modelů podle vašich dat, hardware a způsobu práce. Od dlouhého kontextu a RAG po celý tým agentů se sdílenou persistentní pamětí.

Probrat vlastní nasazení ↗︎