Быстрый старт

Быстрый старт

Версия ядра: 2.0.0 (monorepo)

LevPRO AI runtime — локальный agent runtime на llama-server (OpenAI-compatible HTTP API). Без облачных LLM: async Python и ваша GGUF-модель. Возможности агента (файлы, shell, git, HTTP и т.д.) подключаются через MCP (mcp.json).

Исходный код: gitlab.com/LevPro/ai.

С чего начать

Вариант Для кого Как
Desktop-клиент (Windows) Обычные пользователи — скачать, установить, начать работу Скачать установщик — GUI и мастер настройки
Ядро из исходников Разработчики, интеграции, корпоративный контур Инструкции ниже (pip + config.yaml); для бизнеса — консультация

Большинству пользователей достаточно Desktop. Runtime — для продвинутых сценариев: CLI, HTTP API, кастомные хосты и развёртывание в периметре.

Linux и macOS для desktop — позже. Сборки ядра (CLI / stdio / HTTP) работают на всех платформах с Python 3.11+.

Требования

Компонент Версия
Python 3.11+
llama-server Актуальная сборка llama.cpp с HTTP-сервером
GGUF-модель Любая модель, совместимая с вашей сборкой llama-server

1. Установка пакетов

Клонируйте репозиторий и установите зависимости:

git clone https://gitlab.com/LevPro/ai.git
cd ai
python -m venv .venv
.venv\Scripts\Activate.ps1
pip install -r requirements.txt

Минимальная установка (MCP — hard dependency; память по умолчанию — NullMemoryRetriever):

pip install -e packages/llama-tools
pip install -e packages/local-ai-core

Все опциональные extras:

pip install -e "packages/local-ai-core[all]"

2. Конфигурация

Скопируйте пример конфига и укажите пути на вашей машине:

copy config.example.yaml config.yaml

Минимальный config.yaml:

llama:
  binary_path: "C:/llama/llama-server.exe"
  optimization_mode: balanced
  models:
    main:
      path: "C:/llama/models/your-model.gguf"
      port: 8080

agents:
  assistant:
    tools: []   # mcp_* tools из mcp.json выдаются автоматически

mcp:
  enabled: false
  external_path: null   # по умолчанию: {runtime_data_dir}/mcp.json

Пример {runtime_data_dir}/mcp.json:

{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "C:/path"]
    }
  }
}

Параметры запуска (ctx_size, gpu_layers, n_batch и др.) рассчитываются автоматически из метаданных GGUF и характеристик железа.

Проверьте окружение перед первым чатом:

llama-tools doctor

3. Запуск

# One-shot запрос
local-ai cli --input "hello"

# Интерактивный REPL
local-ai cli

# Переопределение config.yaml на лету
local-ai cli --model-path C:/models/other.gguf --temperature 0.3 --input "hello"

# План запуска без старта llama-server
llama-tools plan
llama-tools plan --json

# Health-check runtime
local-ai health

Интеграция с GUI (Electron и др.)

Готовый desktop-клиент для Windows: скачать. Для своей оболочки используйте stdio-протокол:

local-ai serve-stdio --config config.yaml

NDJSON-запросы на stdin, события и результаты на stdout. Подробнее: stdio_protocol.md.

OpenAI-compatible HTTP (local-ai-core[http]):

local-ai serve-http

Подробнее: http_api.md.

Полезные команды llama-tools

llama-tools doctor
llama-tools plan [--json]
llama-tools inspect <path/to/model.gguf> [--json]
llama-tools benchmark [--output benchmarks/history.json]
llama-tools quantize --model <path/to/model.gguf> [--target-vram MB] [--dry-run]

Авто-квантование: pip install -e "packages/llama-tools[quantize]" (нужен llama-quantize рядом с llama-server).

Что дальше

Нашли ошибку? Сообщите о проблеме или откройте issue в GitLab.