Библиотека AirLLM запускает крупные LLM на GPU с небольшим VRAM. Без квантования, дистилляции и обрезки весов: модель загружается в память послойно, а у MoE-моделей в VRAM передаются только нужные эксперты. Требования к памяти в итоге зависят от размера одного слоя, а не всей модели.
Поддерживаются Llama, Qwen, DeepSeek, Mistral и Gemma. Блочное сжатие ускоряет инференс до 3 раз.
Подойдёт тем, кто хочет гонять большие модели локально на Linux или Apple Silicon без мощной видеокарты.
Полная статья: https://clck.su/HWJqE