2.3.2.9 (ext)
Множественные копии приложения (ключевое)
- Single-instance mutex теперь вычисляется из каталога установки (как имя службы):
D:\NEURO\LlamaGPU и D:\NEURO\LlamaCPU — два независимых экземпляра,
работающих одновременно. Раньше глобальный mutex блокировал вторую копию
(«already running»).
Каталог моделей
- Полные модели с MTP-слоями в имени больше НЕ исключаются из списка:
решаем по метаданным GGUF (архитектура), а не по имени. Qwythos-9B-...-MTP,
Qwen3-Next и т.п. теперь видны как модели.
Честный контекст в API (Hermes-совместимость)
/v1/models отдаёт context_length = реально доступный контекст одного
запроса: min(ContextSize, n_ctx_train) / ParallelSlots. llama-server при
--parallel N сам делит окно на N слотов — клиент (Hermes) планирует сжатие
по фактическому окну, а не по завышенному. Добавлено поле parallel_slots.
- ContextSize профиля берётся из GGUF (источник правды), убран хардкод 524288
для qwen-архитектур.
Полный список коммитов: 42ab1db, 610b46a, c0c2588, 083b4e5.