SGLang без магии: как устроены основные настройки инференса LLM

Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивается на выборе модели и типа данных. Проблемы начинаются дальше: модель перестает помещаться в память, растет очередь запросов, дл...
Читать полный текст в источникеhabr.com — habr.com
Материал собран автоматически из открытых RSS-источников. Пересказ приведён в информационных целях в соответствии со ст. 1274 ГК РФ с указанием первоисточника; полное воспроизведение не осуществляется. Мнения авторов оригинала не обязательно отражают позицию ООО «АЛТЕЯ». Все источники проверены по реестру СМИ-иноагентов Минюста РФ (255-ФЗ).