Быстрый старт
Быстрый старт
Версия ядра: 2.0.0 (monorepo)
LevPRO AI runtime — локальный agent runtime на llama-server (OpenAI-compatible HTTP API). Без облачных LLM: async Python и ваша GGUF-модель. Возможности агента (файлы, shell, git, HTTP и т.д.) подключаются через MCP (mcp.json).
Исходный код: gitlab.com/LevPro/ai.
С чего начать
| Вариант | Для кого | Как |
|---|---|---|
| Desktop-клиент (Windows) | Обычные пользователи — скачать, установить, начать работу | Скачать установщик — GUI и мастер настройки |
| Ядро из исходников | Разработчики, интеграции, корпоративный контур | Инструкции ниже (pip + config.yaml); для бизнеса — консультация |
Большинству пользователей достаточно Desktop. Runtime — для продвинутых сценариев: CLI, HTTP API, кастомные хосты и развёртывание в периметре.
Linux и macOS для desktop — позже. Сборки ядра (CLI / stdio / HTTP) работают на всех платформах с Python 3.11+.
Требования
| Компонент | Версия |
|---|---|
| Python | 3.11+ |
| llama-server | Актуальная сборка llama.cpp с HTTP-сервером |
| GGUF-модель | Любая модель, совместимая с вашей сборкой llama-server |
1. Установка пакетов
Клонируйте репозиторий и установите зависимости:
git clone https://gitlab.com/LevPro/ai.git
cd ai
python -m venv .venv
.venv\Scripts\Activate.ps1
pip install -r requirements.txt
Минимальная установка (MCP — hard dependency; память по умолчанию — NullMemoryRetriever):
pip install -e packages/llama-tools
pip install -e packages/local-ai-core
Все опциональные extras:
pip install -e "packages/local-ai-core[all]"
2. Конфигурация
Скопируйте пример конфига и укажите пути на вашей машине:
copy config.example.yaml config.yaml
Минимальный config.yaml:
llama:
binary_path: "C:/llama/llama-server.exe"
optimization_mode: balanced
models:
main:
path: "C:/llama/models/your-model.gguf"
port: 8080
agents:
assistant:
tools: [] # mcp_* tools из mcp.json выдаются автоматически
mcp:
enabled: false
external_path: null # по умолчанию: {runtime_data_dir}/mcp.json
Пример {runtime_data_dir}/mcp.json:
{
"mcpServers": {
"filesystem": {
"command": "npx",
"args": ["-y", "@modelcontextprotocol/server-filesystem", "C:/path"]
}
}
}
Параметры запуска (ctx_size, gpu_layers, n_batch и др.) рассчитываются автоматически из метаданных GGUF и характеристик железа.
Проверьте окружение перед первым чатом:
llama-tools doctor
3. Запуск
# One-shot запрос
local-ai cli --input "hello"
# Интерактивный REPL
local-ai cli
# Переопределение config.yaml на лету
local-ai cli --model-path C:/models/other.gguf --temperature 0.3 --input "hello"
# План запуска без старта llama-server
llama-tools plan
llama-tools plan --json
# Health-check runtime
local-ai health
Интеграция с GUI (Electron и др.)
Готовый desktop-клиент для Windows: скачать. Для своей оболочки используйте stdio-протокол:
local-ai serve-stdio --config config.yaml
NDJSON-запросы на stdin, события и результаты на stdout. Подробнее: stdio_protocol.md.
OpenAI-compatible HTTP (local-ai-core[http]):
local-ai serve-http
Подробнее: http_api.md.
Полезные команды llama-tools
llama-tools doctor
llama-tools plan [--json]
llama-tools inspect <path/to/model.gguf> [--json]
llama-tools benchmark [--output benchmarks/history.json]
llama-tools quantize --model <path/to/model.gguf> [--target-vram MB] [--dry-run]
Авто-квантование: pip install -e "packages/llama-tools[quantize]" (нужен llama-quantize рядом с llama-server).
Что дальше
- Архитектура — обзор компонентов
- CLI — интерфейс командной строки
- MCP — подключение capability tools через
mcp.json - Память — L0–L3 и RAG (optional
[memory]) - Инструменты — native recovery tools и MCP
- Точки расширения — как расширять runtime
Нашли ошибку? Сообщите о проблеме или откройте issue в GitLab.