Skip to content

2.3.2.9 (ext)

Choose a tag to compare

@MRafStudio MRafStudio released this 06 Sep 12:07
· 0 commits to main since this release

2.3.2.9 (ext)

Множественные копии приложения (ключевое)

  • Single-instance mutex теперь вычисляется из каталога установки (как имя службы):
    D:\NEURO\LlamaGPU и D:\NEURO\LlamaCPU — два независимых экземпляра,
    работающих одновременно. Раньше глобальный mutex блокировал вторую копию
    («already running»).

Каталог моделей

  • Полные модели с MTP-слоями в имени больше НЕ исключаются из списка:
    решаем по метаданным GGUF (архитектура), а не по имени. Qwythos-9B-...-MTP,
    Qwen3-Next и т.п. теперь видны как модели.

Честный контекст в API (Hermes-совместимость)

  • /v1/models отдаёт context_length = реально доступный контекст одного
    запроса: min(ContextSize, n_ctx_train) / ParallelSlots. llama-server при
    --parallel N сам делит окно на N слотов — клиент (Hermes) планирует сжатие
    по фактическому окну, а не по завышенному. Добавлено поле parallel_slots.
  • ContextSize профиля берётся из GGUF (источник правды), убран хардкод 524288
    для qwen-архитектур.

Полный список коммитов: 42ab1db, 610b46a, c0c2588, 083b4e5.