Guide / artifact formats

Quantization

Формат — это часть модели. Не меняйте precision без обновления manifest и regression check.

Format matrix

BF16, Q8 и Q4

ФорматРазмерКачествоКогда выбирать
BF16МаксимальныйBaselineЭталон, GPU, offline evaluation
Q8СреднийБлизко к baselineКогда важна стабильность structured output
Q4МинимальныйЗависит от моделиCPU, constrained RAM, быстрый smoke
Selection rule

Не выбирайте precision по размеру файла

Для JSON, code и reasoning сначала сравнивайте качество на маленьком eval set. Если Q4 ломает структуру ответа, возвращайтесь к Q8 или BF16, а не увеличивайте prompt без диагностики.

Правило реестра: checksum, tokenizer revision и quantization config всегда указываются в одном manifest.
Verification

Проверка артефакта

sha256sum -c model.manifest.json vertex-runtime inspect --precision q4 --show-layers vertex-runtime compare --baseline bf16 --candidate q4

Сохраняйте результат сравнения рядом с профилем. Он помогает объяснить, почему после обновления изменилась latency или качество ответа.

Посмотреть downloads →
Failure modes

Типовые ошибки

  • Файл скачан полностью, но manifest от другой revision.
  • После смены tokenizer меняется количество токенов и context budget.
  • Q4 профиль запускается с batch, который не помещается в KV cache.
  • Сравниваются cold-start и steady-state latency.