Nástroj zdarma
Poběží mi to? Kalkulačka lokálních AI modelů
Vyberte svůj počítač a model — kalkulačka spočítá, jestli se model vejde do paměti, jakou kvantizaci zvolit a jak rychle bude generovat. Počítá s reálnými daty z Hugging Face a se skutečnou propustností paměti vašeho hardwaru.
Na čem to poběží?
Jaký model chcete spustit?
Kvantizace a kontext
Q4_K_M / MLX 4bit: znatelná, ale pro EN použití OK; u malých modelů trpí čeština
Poběží, ale pomalu (část v RAM)
Qwen3.6 35B-A3B (MoE) (Q4_K_M) potřebuje ~23.5 GB, k dispozici je ~15.1 GB + 28.0 GB RAM.
~23.5 GB
váhy 21.8 + kontext 0.2 + režie 1.5
~31–42 tok/s
rychlejší, než stíháte číst
288 GB/s propustnost paměti ÷ 2.4 GB čtených na token, × reálná efektivita. Generování omezuje paměť, ne výpočet.
- Do VRAM se vejde jen ~61 % vah, zbytek čte z pomalejší RAM — rychlost tomu odpovídá.
- U MoE modelů bývá offload méně bolestivý, když ve VRAM zůstanou sdílené vrstvy (llama.cpp: --n-cpu-moe).
Která kvantizace se vám vejde
Čárkovaná linka = paměť dostupná pro model (~15.1 GB). Kliknutím kvantizaci vyberete.
Odhady vycházejí z propustnosti paměti a reálné efektivity běžných aplikací (llama.cpp, LM Studio, Ollama, MLX). Skutečnost se může lišit ±20 % podle verze, délky promptu a zaplnění kontextu. Data modelů: Hugging Face, snapshot 24. 08. 2026.
Jak kalkulačka počítá
Žádná magie, jen aritmetika, kterou si můžete ověřit. Paměť se skládá ze tří položek: váhy modelu (počet parametrů × bity zvolené kvantizace ÷ 8), KV cache (paměť, ve které si model drží rozpracovaný kontext) a pár set MB až jednotky GB režie běhového prostředí. KV cache počítáme podle skutečné architektury — u modelů s hybridní lineární pozorností (Qwen 3.6, Ornith, Bonsai) nebo lokálními okny (Gemma 4, gpt-oss) roste s kontextem jen zlomek vrstev, takže dlouhý kontext stojí řádově méně, než by napovídal starý vzorec.
Rychlost generování je u velkých jazykových modelů skoro vždycky omezená propustností paměti, ne výpočetním výkonem. Na každý vygenerovaný token musí čip přečíst všechny aktivní váhy modelu. Proto horní odhad rychlosti = propustnost paměti ÷ velikost aktivních vah — a reálný výsledek je o 25–45 % nižší podle platformy a běhového prostředí. Přesně s tímhle kalkulačka počítá a odhady jsme kalibrovali na veřejné benchmarky llama.cpp, LM Studia a MLX.
Počty parametrů a architekturu modelů nebereme z marketingových materiálů, ale přímo z metadat na Hugging Face (config.json + safetensors) — včetně případů, kdy metadata lžou (modely vydané nativně ve FP4 hlásí polovinu parametrů; přepočítáváme je z architektury). U kvantizací počítáme efektivní bity na váhu podle skutečných velikostí GGUF souborů, proto vám čísla budou sedět s tím, co reálně stáhnete.
Co se za poslední rok změnilo
Hybridní lineární pozornost zlevnila dlouhý kontext. Nová generace modelů (Qwen 3.6, Gemma 4, Ornith, Qwen3 Coder Next) už neskládá samé klasické attention vrstvy — tři čtvrtiny vrstev nahrazuje lineární pozorností, která si nedrží celou historii. Výsledek: 256K kontext, který dřív spolkl desítky GB, dnes u Gemma 4 12B zabere zhruba 2 GB. Kalkulačka to zohledňuje u každého modelu zvlášť.
MoE se stalo normou. Většina nových modelů nese desítky až stovky miliard parametrů, ale na token jich aktivuje jen pár — Gemma 4 26B-A4B, Qwen3.6 35B-A3B nebo Hy3 (295 mld., aktivních ~21 mld.). Přesně tahle kategorie dělá z Maců, DGX Sparků a PC s hodně RAM plnohodnotné AI stroje.
Nativně nízkobitové modely. Bonsai 27B od PrismML je Qwen3.6-27B přetrénovaný do ~1bitových vah: 27miliardový model v souboru o velikosti 3,8 GB, který si podle autorů drží ~90 % kvality originálu. Není to klasická kvantizace, kterou si vyberete — model se tak rovnou dodává (potřebuje aktuální llama.cpp nebo MLX).
I obří modely jdou domů. Dynamické 1–2bitové kvantizace (unsloth UD) zvládnou GLM-5.2 (753 mld.) na dvou DGX Sparcích a DeepSeek V4 Flash nebo Hy3 na jednom výkonném stroji se 128+ GB. Kvalita je znatelně nižší než u Q4 a dekomprese ubírá rychlost — ale ještě loni to nešlo vůbec.
Co je kvantizace a jakou zvolit
Kvantizace je komprese vah modelu — místo 16 bitů na číslo se uloží 8, 4 nebo i méně. Model se tím zmenší a zrychlí (čte se méně dat), za cenu drobné ztráty přesnosti. V praxi: Q8 je prakticky k nerozeznání od originálu, Q6 skoro taky, Q4 je rozumný kompromis a pod Q4 už kvalita znatelně padá. Výjimkou jsou obří MoE modely, kde extrémní dynamické kvantizace (IQ2, unsloth „1bit“) drží pozornost a sdílené vrstvy v ~5 bitech a šetří jen na expertech — proto je kalkulačka nabízí jen u MoE modelů nad 100 mld. parametrů.
Pro češtinu doporučujeme být konzervativnější: malé modely (do ~10 mld. parametrů) začínají při agresivní kvantizaci komolit skloňování a diakritiku dřív, než se to projeví v angličtině. U nich se držte Q8; u modelů kolem 12–35 mld. stačí Q6 a velké modely snesou Q4 bez viditelné újmy.
Pozor na modely, které se nativně dodávají v nízké přesnosti — gpt-oss (MXFP4), DeepSeek V4 (FP8/FP4) nebo Bonsai (1bitový QAT). U nich kvantizaci nevybíráte, počítá se reálná velikost souboru. Formát souborů se pak liší podle běhového prostředí: GGUF používá llama.cpp, LM Studio, Ollama a Jan (funguje všude — Windows, Linux, Mac), MLX je formát optimalizovaný pro Apple Silicon. Prakticky: nainstalujte si LM Studio nebo Ollamu, vyhledejte model podle jména a aplikace vám správný soubor nabídne sama.
Proč jsou MoE modely pro domácí hardware zajímavé
MoE (Mixture of Experts) modely mají velký mozek, ale na každý token z něj zapojí jen zlomek — třeba Qwen3.6 35B-A3B nese 36 mld. parametrů, ale aktivně počítá jen s ~4 mld. Do paměti se musí vejít celý, jenže číst se na každý token musí jen ta aktivní část. Výsledek: znalosti velkého modelu, rychlost malého. Na strojích s hodně pamětí a pomalejší propustností (Macy, DGX Spark, PC s hodně RAM) je to nejvýhodnější kategorie — a v roce 2026 už i hlavní proud: Gemma 4 26B-A4B, GLM-4.7 Flash, Qwen3 Coder Next.
Bonus pro majitele slabších grafik: u MoE modelů funguje překvapivě dobře rozdělení mezi GPU a RAM (v llama.cpp přepínač --n-cpu-moe), kdy sdílené vrstvy zůstanou na grafice a experti se čtou z RAM.
Na co si dát pozor
- Zpracování dlouhého promptu je jiná disciplína. Kalkulačka odhaduje rychlost generování odpovědi. Načtení dlouhého vstupu (třeba celého dokumentu) je omezené výpočetním výkonem — a tam jsou grafiky NVIDIA výrazně rychlejší než Macy. Na Macu s velkým kontextem počítejte s desítkami sekund až minutami čekání, než model začne odpovídat.
- Nové architektury chtějí aktuální software. Hybridní modely (Qwen 3.6, Gemma 4, Bonsai) potřebují čerstvou verzi llama.cpp, LM Studia nebo Ollamy. Když aplikace model odmítne nebo generuje nesmysly, první krok je aktualizace — ne menší kvantizace.
- macOS limituje paměť pro GPU. Standardně pustí grafickou část k ~67–75 % sjednocené paměti. Limit jde dočasně zvýšit příkazem
sudo sysctl iogpu.wired_limit_mb=…, ale nechte systému aspoň 8 GB, jinak se Mac zadusí. - Více grafik ≠ automaticky vyšší rychlost. Druhá karta přidá paměť, ale llama.cpp dělí model po vrstvách, takže rychlost zůstává zhruba na úrovni jedné karty. Škálovat rychlost umí až vLLM s tensor parallelismem.
- Kontext pořád žere paměť — u starších modelů. Klasické architektury (Llama 3, Qwen3, Hy3) mají KV cache, která při plném kontextu klidně přeroste váhy. Pokud se nevejdete, zmenšete kontext nebo kvantizujte KV cache na Q8 — obojí si v kalkulačce můžete vyzkoušet. Hybridní modely tenhle problém z velké části řeší samy.
Časté otázky
Kolik tokenů za sekundu je „dost“?
Člověk čte zhruba 5–7 tokenů za sekundu. Cokoliv nad ~10 tok/s působí plynule, nad 20 tok/s už rychlost přestáváte vnímat. Pro dávkové úlohy (přepisy, sumarizace přes noc) klidně stačí i 3–5 tok/s. U agentních úloh (kódování, práce s nástroji) platí čím víc, tím líp — model generuje mnohonásobně víc textu, než čtete.
Proč mi reálná rychlost vyšla jinak než v kalkulačce?
Odhad je střed pásma ±20 %. Roli hraje verze runtime, kvantizace KV cache, zaplnění kontextu (čím delší konverzace, tím pomalejší generování) a u notebooků snižování výkonu při přehřátí (throttling). Pokud jste výrazně pod odhadem, zkontrolujte, že model opravdu běží na GPU a ne na CPU — a u nových architektur že máte aktuální verzi aplikace.
Jaký model je nejlepší na češtinu?
V našich testech na reálné tvorbě českého obsahu vede Qwen 3.6 a z obřích DeepSeek V4 nebo GLM-5.2; Gemma 4 je solidní na konverzaci, ale na tvorbu textů u nás vycházela hůř — podrobnosti v našem žebříčku češtiny níže. Obecně platí: větší model v nižší kvantizaci bývá na češtinu lepší než malý model v plné přesnosti — a pod Q4 čeština trpí jako první. Malé modely do ~10 mld. parametrů češtinu komolí i v Q8, na vážnou práci s českým textem počítejte s 12+ mld.
Nemám žádnou grafiku. Má to vůbec smysl?
Má — díky MoE modelům. Qwen3.6 35B-A3B v Q4 poběží na běžném PC s 32 GB DDR5 kolem 15 tokenů za sekundu, což je pohodlné tempo. Běžný (hustý) model stejné velikosti by na stejném stroji lezl pod 2 tok/s. A Bonsai 27B má v 1bitové verzi váhy jen 3,8 GB — PrismML ho předvádí i na telefonu.
Podle čeho vybíráte předvolené modely?
Automaticky. Skript pravidelně čte žebříčky Hugging Face (trending + počty stažení včetně odvozených kopií), bere jen originály od ověřených vydavatelů a doplňuje pár klasik. Parametry čteme z metadat modelů, u vlastních odkazů živě. Propustnosti hardwaru pocházejí z oficiálních specifikací a efektivitu jsme kalibrovali na veřejné benchmarky. Najdete-li nesrovnalost, napište nám — opravíme ji.
Pokračujte v rozhodování
Řešíte AI i na svém webu?
Lokální modely jsou zábava — ale jestli podnikáte, důležitější je, aby vás AI vyhledávače a Google vůbec našly. Podívám se na váš web zdarma a řeknu vám, co mu brání růst.
Chci audit zdarma