Guide / artifact formats
Quantization
Формат — это часть модели. Не меняйте precision без обновления manifest и regression check.
Format matrix
BF16, Q8 и Q4
| Формат | Размер | Качество | Когда выбирать |
|---|---|---|---|
| BF16 | Максимальный | Baseline | Эталон, GPU, offline evaluation |
| Q8 | Средний | Близко к baseline | Когда важна стабильность structured output |
| Q4 | Минимальный | Зависит от модели | CPU, constrained RAM, быстрый smoke |
Selection rule
Не выбирайте precision по размеру файла
Для JSON, code и reasoning сначала сравнивайте качество на маленьком eval set. Если Q4 ломает структуру ответа, возвращайтесь к Q8 или BF16, а не увеличивайте prompt без диагностики.
Правило реестра: checksum, tokenizer revision и quantization config всегда указываются в одном manifest.
Verification
Проверка артефакта
sha256sum -c model.manifest.json
vertex-runtime inspect --precision q4 --show-layers
vertex-runtime compare --baseline bf16 --candidate q4Сохраняйте результат сравнения рядом с профилем. Он помогает объяснить, почему после обновления изменилась latency или качество ответа.
Посмотреть downloads →Failure modes
Типовые ошибки
- Файл скачан полностью, но manifest от другой revision.
- После смены tokenizer меняется количество токенов и context budget.
- Q4 профиль запускается с batch, который не помещается в KV cache.
- Сравниваются cold-start и steady-state latency.