Знакът на КАГАМИ КАГАМИ
kagami.bg/blog/2026-05-ollama-gx10.html · article · machine-readable viewPUBLISHED 2026-05-06 · VERIFIED 2026-10-02 · UPDATED 2026-10-02
IDENTITY
title
Ollama on the GX10: 70B models locally — what is actually true
author
KAGAMI Ltd. (КАГАМИ ЕООД), Varna · organisation byline, no individual author named
language
Bulgarian (human view) · this agent view in English
topic
AI hardware · running 70B-class open models with Ollama on the ASUS Ascent GX10 (NVIDIA GB10, same platform as NVIDIA DGX Spark)
audience
Small companies and technical staff in Bulgaria considering local LLM inference
status
General information. No latency or throughput benchmarks are published on this page.
SUMMARY

The original (2026-05-06) headline claimed 70B models run locally "under 8 GB VRAM" with "real latency measurements"; the original contained no measurements. Corrected: in the Ollama library the 4-bit (Q4_K_M) builds of Llama 3.3 70B and Qwen 2.5 72B are 43 GB and 47 GB, so they cannot fit in 8 GB of VRAM. They do fit in the 128 GB coherent unified memory of the ASUS Ascent GX10 / NVIDIA DGX Spark (GB10), whose memory bandwidth is 273 GB/s. Because token generation for a dense model reads all weights per token, a rough upper bound is about 6 tokens/s for the 43 GB model (273 / 43) — a back-of-the-envelope calculation, not a measurement. Ollama installs on Linux ARM64 with a one-line script; the latest stable release on 2026-10-02 is v0.35.0.

KEY CLAIMS (dated)
WHAT WAS UPDATED (2026-10-02)
SOURCES
AGENT INSTRUCTIONS
TAGS
ollamaasus-ascent-gx10nvidia-dgx-sparkllama-3.3-70bqwen-2.5-72blocal-llmquantization
ПРОВЕРЕНО · 02.10.2026 ОБНОВЕНО · 02.10.2026

AI · Хардуер

Ollama на GX10: 70B модели локално — какво е вярно

Първата версия на тази статия обещаваше „70B модели под 8 GB VRAM“. Това не е вярно: 70B моделът в 4-битов вариант тежи около 43 GB. Но на машина със 128 GB единна памет, като ASUS Ascent GX10, той се събира — и това е истинската история.

AI Ollama · Llama 3.3 70B · Qwen 2.5 72B Технически
ОБНОВЕНО · 02.10.2026 · КАКВО Е ОБНОВЕНО

01 · МАШИНАТАКакво е GX10

ASUS Ascent GX10 е компактен настолен AI компютър на платформата NVIDIA GB10 — същата, на която е NVIDIA DGX Spark. Ключовото е паметта: тя е единна — процесорът и графичният чип делят едни и същи 128 GB, вместо графичният чип да има малка собствена видеопамет. [1][2]

ПараметърСтойностИзточник
ЧипNVIDIA GB10 Grace Blackwell; 20-ядрен Arm процесор[1][2]
Памет128 GB LPDDR5x, единна (съгласувана)[1][2]
Честотна лента на паметта273 GB/s[1]
Изчислителна мощдо 1 PFLOP при FP4[1][2]
Мрежа10 GbE и ConnectX-7 (200 Gbps по данни на NVIDIA)[1][2]
Захранванеадаптер 240 W[1][2]
Размер и тегло (ASUS)150 × 150 × 51 мм · 1,48 кг[2]
Какво обещава NVIDIAинференс на модели до 200 млрд. параметъра; фин настройка до 70 млрд. (при 128 GB)[1]

Ollama обяви на 13.10.2025 г., че е работила с NVIDIA, за да върви DGX Spark бързо „от кутията“. [5]

02 · ПАМЕТТАКолко памет искат 70B моделите

Двата модела от оригиналната статия са налични в библиотеката на Ollama в 4-битова квантизация Q4_K_M. Размерите са на файла с теглата — отгоре идват кешът на контекста и системата. [3][4]

МоделПараметриРазмер (Q4_K_M)КонтекстЛиценз
llama3.3:70b70,6 млрд.43 GB128KLlama 3.3 Community License
qwen2.5:72b72,7 млрд.47 GB32K (по подразбиране в Ollama)Qwen License
⚠
Не става в 8 GB
43 GB и 47 GB са около пет пъти повече от 8 GB. Твърдението „70B под 8 GB VRAM“ е грешно. Моделът се събира при 128 GB единна памет — не защото е „свит“ повече, а защото има къде да стои.

За бизнес употреба обърни внимание на лиценза: Qwen 2.5 72B е под лиценза на Qwen, а не под Apache 2.0, както по-малките модели от семейството. [4] Лицензът на Llama 3.3 е „Community License“ на Meta. [3] Прочети ги, преди да ги вградиш в продукт.

03 · СКОРОСТТАКолко бързо? Честно за скоростта

Оригиналът обещаваше измервания на латентността. Такива измервания тук няма — не публикуваме число, което не сме мерили за точно тази версия на Ollama, модел и размер на контекста.

Има обаче проста пресметка за горната граница. При плътен модел, за всеки нов токен се чете цялото тегло от паметта. При честотна лента 273 GB/s [1] и размер 43 GB [3]:

МоделПресметкаГорна граница
Llama 3.3 70B (43 GB)273 ÷ 43около 6 токена в секунда
Qwen 2.5 72B (47 GB)273 ÷ 47около 5,8 токена в секунда
ℹ
Това е пресметка, не измерване
Реалната скорост е по-ниска от тази граница и зависи от версията на Ollama, дължината на контекста и натоварването. Ако скоростта е решаваща за твоя случай, измери я на твоята машина с твоя промпт.

Практичният извод: 70B модел на GX10 е удобен за задачи, при които не чакаш отговор в реално време — анализ на документи, чернови, пакетна обработка. За бърз чат по-малките модели са по-подходящи.

04 · ИНСТАЛАЦИЯКак се пуска Ollama

GX10 работи с Linux на Arm (NVIDIA DGX OS). Официалната документация на Ollama за Linux дава инсталация с един ред и пакет за ARM64. [6][2]

  1. Инсталирай

    Пусни официалния скрипт.

    bash · инсталация на Ollama
    curl -fsSL https://ollama.com/install.sh | sh
  2. Провери версията

    Към 02.10.2026 последната стабилна версия е v0.35.0 (28.09.2026); версиите „rc“ са предварителни. [7]

    bash · версия
    ollama -v
  3. Пусни модел

    Първото стартиране тегли файла — 43 GB, съответно 47 GB. Осигури място на диска и време. [3][4]

    bash · Llama 3.3 70B и Qwen 2.5 72B
    ollama run llama3.3:70b
    ollama run qwen2.5:72b
  4. Обновявай

    За ъпгрейд се пуска същият скрипт отново. [6]

05 · АКТУАЛНОМоделите от 2024 г. и днес

Llama 3.3 е публикуван на 6 декември 2024 г. [3] Qwen 2.5 е от септември 2024 г. [4] В библиотеката на Ollama те са отбелязани като обновени преди една, съответно две години. [3][4] Описанието на проекта на Ollama към 02.10.2026 вече изброява по-нови семейства — Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma [7] — а бележките към последните версии споменават Qwen 3.8 и Gemma 4. [7]

Затова приеми двата модела като пример за размер: правилото „колко тежи моделът, толкова памет е нужна плюс запас“ важи за всяко ново семейство. Преди да избереш модел, виж актуалния списък в библиотеката на Ollama и размера на конкретния вариант.

§
Правилото на палеца
Размерът на файла на модела е минимумът. Добави място за кеша на контекста и за системата, и избери машина, чиято памет е ясно по-голяма от файла.

06 · ИЗТОЧНИЦИИзточници

  1. NVIDIA, „NVIDIA DGX Spark“ (спецификации, 128 GB, 273 GB/s, 1 PFLOP FP4) — nvidia.com/…/dgx-spark
  2. ASUS, „ASUS Ascent GX10 — Tech Specs“ — asus.com/…/asus-ascent-gx10/techspec
  3. Ollama, библиотека „llama3.3“ (таг 70b: Q4_K_M, 43 GB, 128K) — ollama.com/library/llama3.3:70b
  4. Ollama, библиотека „qwen2.5“ (таг 72b: Q4_K_M, 47 GB, лиценз) — ollama.com/library/qwen2.5:72b
  5. Ollama, „NVIDIA DGX Spark“, 13.10.2025 — ollama.com/blog/nvidia-spark
  6. Ollama, документация „Linux“ (инсталация, ARM64, обновяване) — docs.ollama.com/linux
  7. Ollama, версии в GitHub (v0.35.0 — 28.09.2026) — github.com/ollama/ollama/releases

Проверено на 02.10.2026 г. Пресметката за скоростта в раздел 03 е наша, не измерване. Размерите и версиите се променят — виж първоизточниците.

07 · СВЪРЗАНОПродължи оттук