LLM Engine 0.9.1 — обновление локального движка инференса: потоковая генерация, расширенный контекст и заметный прирост скорости на архитектуре Ada Lovelace.
Новые возможности
- Streaming API для потоковой генерации текста
- Поддержка контекстного окна до 32K токенов
- Одновременная поддержка embeddings- и генеративных моделей и API
- Параметр
stop_sequencesдля управления завершением генерации - Базовый UI для проверки и взаимодействия с моделями
Изменения
- Скорость инференса выросла на 40% на RTX 40xx (Ada Lovelace)
- Обновлён формат конфигурационного файла: добавлены поля
gpu_layersиcontext_size
Удалено
- Устаревший эндпоинт
/api/v0/complete— используйте/api/v1/generate
Как обновиться
Дистрибутивы для Windows и Docker — на странице загрузки. Полный список изменений — в истории версий.