Guide / decision matrix

Выбор модели

Не начинайте с максимального числа параметров. Сначала определите задачу, контекст и бюджет памяти.

Decision tree

Ответьте на четыре вопроса

Какой результат нужен?

Короткий ответ, structured extraction, code patch, embedding или многошаговое рассуждение.

Сколько контекста требуется?

Для документа до 16K подойдёт compact profile. Для репозитория или отчёта нужен chunking и retrieval.

Какой бюджет памяти?

Оставьте минимум 20% RAM под KV cache и запас операционной системы.

Нужна ли offline reproducibility?

Фиксируйте manifest, seed и формат; иначе обновление runtime может изменить результат.

Comparison

Короткая матрица

МодельЛучший сценарийContextСтартовый RAMФормат
Aster-8BАссистент, extraction, JSON32K8 GBQ4 / Q8 / BF16
Nyx-14B CodeCode review, diff, repo64K12 GBQ4 / Q8 / BF16
Orion-32BReasoning, planning128K24 GBQ4 / BF16
Mica-EmbedRAG, search, clustering8K4 GBQ8 / BF16
Quartz-VisionPDF, schema, screenshot16K8 GBQ4 / BF16
Anti-patterns

Чего лучше не делать

  • Выбирать модель только по числу параметров.
  • Использовать BF16 на машине, где достаточно Q4.
  • Увеличивать context без chunking и retrieval.
  • Смешивать старый prompt с новым tokenizer revision.
  • Считать cold-start обычной задержкой.
Открыть каталог →