AI · Хардуер
Ollama на GX10: 70B модели локално — какво е вярно
Първата версия на тази статия обещаваше „70B модели под 8 GB VRAM“. Това не е вярно: 70B моделът в 4-битов вариант тежи около 43 GB. Но на машина със 128 GB единна памет, като ASUS Ascent GX10, той се събира — и това е истинската история.
- Заглавието на оригинала (06.05.2026) твърдеше, че 70B модели работят локално под 8 GB VRAM.
„70B модели локално под 8GB VRAM“→ Llama 3.3 70B (Q4_K_M) е 43 GB, Qwen 2.5 72B (Q4_K_M) е 47 GB — около пет пъти повече от 8 GB; събират се в 128 GB единна памет на GX10. [3][4][1][2] - Оригиналът обещаваше „реални latency измервания на DGX Spark“, но не съдържаше нито едно.
„реални latency измервания“→ измервания тук няма; даваме само пресметната горна граница по честотната лента на паметта, ясно означена като пресметка. [1][3] - Добавено: спецификации на GX10 по официалните страници на ASUS и NVIDIA, стъпки за инсталация, текуща версия на Ollama (v0.35.0 към 02.10.2026), бележка за лиценза на Qwen и източници — оригиналът беше заготовка от около 70 думи. [2][6][7][4]
01 · МАШИНАТАКакво е GX10
ASUS Ascent GX10 е компактен настолен AI компютър на платформата NVIDIA GB10 — същата, на която е NVIDIA DGX Spark. Ключовото е паметта: тя е единна — процесорът и графичният чип делят едни и същи 128 GB, вместо графичният чип да има малка собствена видеопамет. [1][2]
| Параметър | Стойност | Източник |
|---|---|---|
| Чип | NVIDIA GB10 Grace Blackwell; 20-ядрен Arm процесор | [1][2] |
| Памет | 128 GB LPDDR5x, единна (съгласувана) | [1][2] |
| Честотна лента на паметта | 273 GB/s | [1] |
| Изчислителна мощ | до 1 PFLOP при FP4 | [1][2] |
| Мрежа | 10 GbE и ConnectX-7 (200 Gbps по данни на NVIDIA) | [1][2] |
| Захранване | адаптер 240 W | [1][2] |
| Размер и тегло (ASUS) | 150 × 150 × 51 мм · 1,48 кг | [2] |
| Какво обещава NVIDIA | инференс на модели до 200 млрд. параметъра; фин настройка до 70 млрд. (при 128 GB) | [1] |
Ollama обяви на 13.10.2025 г., че е работила с NVIDIA, за да върви DGX Spark бързо „от кутията“. [5]
02 · ПАМЕТТАКолко памет искат 70B моделите
Двата модела от оригиналната статия са налични в библиотеката на Ollama в 4-битова квантизация Q4_K_M. Размерите са на файла с теглата — отгоре идват кешът на контекста и системата. [3][4]
| Модел | Параметри | Размер (Q4_K_M) | Контекст | Лиценз |
|---|---|---|---|---|
| llama3.3:70b | 70,6 млрд. | 43 GB | 128K | Llama 3.3 Community License |
| qwen2.5:72b | 72,7 млрд. | 47 GB | 32K (по подразбиране в Ollama) | Qwen License |
За бизнес употреба обърни внимание на лиценза: Qwen 2.5 72B е под лиценза на Qwen, а не под Apache 2.0, както по-малките модели от семейството. [4] Лицензът на Llama 3.3 е „Community License“ на Meta. [3] Прочети ги, преди да ги вградиш в продукт.
03 · СКОРОСТТАКолко бързо? Честно за скоростта
Оригиналът обещаваше измервания на латентността. Такива измервания тук няма — не публикуваме число, което не сме мерили за точно тази версия на Ollama, модел и размер на контекста.
Има обаче проста пресметка за горната граница. При плътен модел, за всеки нов токен се чете цялото тегло от паметта. При честотна лента 273 GB/s [1] и размер 43 GB [3]:
| Модел | Пресметка | Горна граница |
|---|---|---|
| Llama 3.3 70B (43 GB) | 273 ÷ 43 | около 6 токена в секунда |
| Qwen 2.5 72B (47 GB) | 273 ÷ 47 | около 5,8 токена в секунда |
Практичният извод: 70B модел на GX10 е удобен за задачи, при които не чакаш отговор в реално време — анализ на документи, чернови, пакетна обработка. За бърз чат по-малките модели са по-подходящи.
04 · ИНСТАЛАЦИЯКак се пуска Ollama
GX10 работи с Linux на Arm (NVIDIA DGX OS). Официалната документация на Ollama за Linux дава инсталация с един ред и пакет за ARM64. [6][2]
Инсталирай
Пусни официалния скрипт.
bash · инсталация на Ollamacurl -fsSL https://ollama.com/install.sh | shПровери версията
Към 02.10.2026 последната стабилна версия е v0.35.0 (28.09.2026); версиите „rc“ са предварителни. [7]
bash · версияollama -vПусни модел
Първото стартиране тегли файла — 43 GB, съответно 47 GB. Осигури място на диска и време. [3][4]
bash · Llama 3.3 70B и Qwen 2.5 72Bollama run llama3.3:70b ollama run qwen2.5:72bОбновявай
За ъпгрейд се пуска същият скрипт отново. [6]
05 · АКТУАЛНОМоделите от 2024 г. и днес
Llama 3.3 е публикуван на 6 декември 2024 г. [3] Qwen 2.5 е от септември 2024 г. [4] В библиотеката на Ollama те са отбелязани като обновени преди една, съответно две години. [3][4] Описанието на проекта на Ollama към 02.10.2026 вече изброява по-нови семейства — Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma [7] — а бележките към последните версии споменават Qwen 3.8 и Gemma 4. [7]
Затова приеми двата модела като пример за размер: правилото „колко тежи моделът, толкова памет е нужна плюс запас“ важи за всяко ново семейство. Преди да избереш модел, виж актуалния списък в библиотеката на Ollama и размера на конкретния вариант.
06 · ИЗТОЧНИЦИИзточници
- NVIDIA, „NVIDIA DGX Spark“ (спецификации, 128 GB, 273 GB/s, 1 PFLOP FP4) — nvidia.com/…/dgx-spark
- ASUS, „ASUS Ascent GX10 — Tech Specs“ — asus.com/…/asus-ascent-gx10/techspec
- Ollama, библиотека „llama3.3“ (таг 70b: Q4_K_M, 43 GB, 128K) — ollama.com/library/llama3.3:70b
- Ollama, библиотека „qwen2.5“ (таг 72b: Q4_K_M, 47 GB, лиценз) — ollama.com/library/qwen2.5:72b
- Ollama, „NVIDIA DGX Spark“, 13.10.2025 — ollama.com/blog/nvidia-spark
- Ollama, документация „Linux“ (инсталация, ARM64, обновяване) — docs.ollama.com/linux
- Ollama, версии в GitHub (v0.35.0 — 28.09.2026) — github.com/ollama/ollama/releases
Проверено на 02.10.2026 г. Пресметката за скоростта в раздел 03 е наша, не измерване. Размерите и версиите се променят — виж първоизточниците.