AirLLM: большие языковые модели на видеокартах с малым объёмом памяти

2026-08-30 · Бельский.ком
Библиотека AirLLM запускает крупные LLM на GPU с небольшим VRAM. Без квантования, дистилляции и обрезки весов: модель загружается в память послойно, а у MoE-моделей в VRAM передаются только нужные эксперты. Требования к памяти в итоге зависят от размера одного слоя, а не всей модели. Поддерживаются Llama, Qwen, DeepSeek, Mistral и Gemma. Блочное сжатие ускоряет инференс до 3 раз. Подойдёт тем, кто хочет гонять большие модели локально на Linux или Apple Silicon без мощной видеокарты. Полная статья: https://clck.su/HWJqE
Подписывайтесь на наши каналы:
← Все новости