LLM Engine 0.9.1 — обновление локального движка инференса: потоковая генерация, расширенный контекст и заметный прирост скорости на архитектуре Ada Lovelace.

Новые возможности

  • Streaming API для потоковой генерации текста
  • Поддержка контекстного окна до 32K токенов
  • Одновременная поддержка embeddings- и генеративных моделей и API
  • Параметр stop_sequences для управления завершением генерации
  • Базовый UI для проверки и взаимодействия с моделями

Изменения

  • Скорость инференса выросла на 40% на RTX 40xx (Ada Lovelace)
  • Обновлён формат конфигурационного файла: добавлены поля gpu_layers и context_size

Удалено

  • Устаревший эндпоинт /api/v0/complete — используйте /api/v1/generate

Как обновиться

Дистрибутивы для Windows и Docker — на странице загрузки. Полный список изменений — в истории версий.