LevPRO AI — Безопасный локальный AI

Для большинства пользователей — Desktop: скачайте приложение, пройдите мастер настройки и работайте с локальным ИИ. Для разработчиков и команд — ядро (CLI, HTTP API, MCP). После установки модели интернет не нужен. Фокус — приватность, контроль и расширяемость.

Ключевые особенности

Desktop GUI

Готовый клиент для Windows с мастером настройки и чатами; Linux/macOS — позже.

Локальный запуск

venv / bare metal — полный контроль над инфраструктурой без облачных LLM.

Многоуровневая память

Optional L0–L3 и RAG (BM25) для ответов по Markdown без vector DB.

MCP-инструменты

Capabilities из mcp.json; в ядре — recovery tools и ApprovalGate.

Интерфейсы

CLI, stdio NDJSON для хостов, OpenAI-compatible HTTP с SSE.

Надёжность

Супервизор llama-server, circuit breaker, healthchecks, структурированные логи.

Документация и тесты

Markdown-docs, pytest/Hypothesis, coverage gate ≥70%, CI на Ubuntu и Windows.

Технологический стек

Локальный async-runtime на Python: только llama-server, без облачных LLM, LangChain и vector DB.

Ядро и runtime

  • Python 3.11+ — основной язык и async-архитектура
  • asyncio — агенты, сессии, супервизор процессов
  • httpx — клиент к llama-server (OpenAI-compatible)
  • local-ai-mcp — MCP bridge (stdio + HTTP)

AI и инференс

  • llama.cpp — llama-server, GGUF, LoRA, mmproj
  • ReAct loop — tool-calling с circuit breaker
  • Planner / autotune — launch-параметры под железо
  • Ensemble — optional multi-model routing

Память и RAG

  • BM25 — поиск по Markdown без vector DB (optional hybrid)
  • Embeddings — опционально через llama-server
  • L0–L3 — файловая runtime-память (extra [memory])
  • YAML / JSON / Markdown — конфиг и хранилище

Безопасность

  • DirectoryGuard — ограничение путей Core (runtime data / skills)
  • ApprovalGate — подтверждение MCP-tools с requires_approval
  • jsonschema — валидация аргументов tools
  • Host mcp.json — какие серверы и tools доступны агенту

DevOps и качество

  • pytest + Hypothesis — unit-тесты, coverage ≥70%
  • ruff + mypy — линтинг и статическая типизация
  • CI — Ubuntu и Windows (Python 3.11/3.12)
  • llama-tools — doctor, plan, inspect, benchmark, quantize

Наблюдаемость

  • Structured logging — text/JSON в logs/
  • Event tags — LLM, tools, MCP, memory, monitor
  • local-ai health — проверка runtime и llama-server
  • Monitor extra — optional RAM/VRAM polling

Где и как применять

LevPRO AI — не готовый чат-бот и не набор интеграций «из коробки», а runtime для локальных агентов. Внешние системы подключаются через MCP-серверы хоста.

Что даёт ядро

Локальный ReAct-агент

Суть
Цикл рассуждение → tool call → ответ поверх вашей GGUF-модели на llama-server.
Как использовать
local-ai cli, Desktop через stdio или serve-http для клиентов.
Плюсы
Данные инференса остаются на вашей машине; нет облачных LLM API.

Расширения через MCP

Суть
Файлы, shell, git, HTTP и любые другие tools — из mcp.json (stdio или HTTP).
Как использовать
Хост добавляет MCP-серверы; tools появляются как mcp_{server}_{tool}.
Плюсы
Ядро не тащит встроенный sandbox/FS/git: вы сами выбираете, что доступно агенту.

RAG по Markdown

Суть
Optional extra [memory]: BM25 (и hybrid) по файловому Markdown-хранилищу, L0–L3.
Как использовать
Включить memory.enabled, положить документы в memory data dir.
Плюсы
Без Pinecone/Weaviate; подходит для внутренней документации в Markdown.

Операции и железо

Суть
Супервизор llama-server, planner/autotune, optional monitor и graceful degradation.
Как использовать
llama-tools doctor / plan, local-ai health, extras [monitor] / [autotune].
Плюсы
Меньше ручной возни с ctx/gpu_layers; контроль RAM/VRAM под нагрузкой.

Что собирают поверх

Coding- и DevOps-агенты

Суть
Ассистент по коду, ревью, runbook — если хост дал нужные MCP-серверы.
Как использовать
Подключить filesystem/git/shell (или свои) MCP; настроить промпты агента.
Плюсы
Код и секреты не уходят в облачный LLM; интеграции — на вашей стороне.

Ассистент в периметре

Суть
Внутренний чат/агент внутри периметра для команд с требованиями к приватности.
Как использовать
Развернуть LevPRO AI runtime + модель; при необходимости HTTP API за reverse proxy.
Плюсы
Контроль над данными инференса; соответствие политикам периметра — на стороне внедрения.

Альтернатива LangChain

Суть
Минималистичный runtime без LangChain/LlamaIndex: понятный ReAct и конфиг.
Как использовать
Форкнуть, править агентов/промпты, подключать MCP и extras.
Плюсы
Меньше «магии», проще дебажить, MIT.

Multi-model и skills

Суть
Ensemble — разные GGUF на разных агентах; skills — захват успешных процедур.
Как использовать
Extras [ensemble] и [skills] в конфиге.
Плюсы
Маршрутизация по задачам и накопление рабочих приёмов без облака.

Частые вопросы

Ответы на популярные вопросы об LevPRO AI— от требований к железу до безопасности и расширения.

Это локальный runtime на вашем оборудовании: инференс через llama-server, без облачных LLM API и подписок. Не готовый чат-бот, а agent runtime: сессии, ReAct, MCP-tools и опциональные extras.

Нет. После установки модели и зависимостей ассистент работает полностью офлайн. Интернет может понадобиться только для первоначальной загрузки llama-server, GGUF-модели и пакетов Python.

Минимум — Python 3.11+, свежая сборка llama-server и GGUF-модель под вашу задачу. Параметры запуска (контекст, GPU-слои, batch) рассчитываются автоматически из метаданных модели и характеристик системы. Перед стартом можно проверить совместимость командой llama-tools doctor.

Это runtime/фреймворк. Из коробки — CLI, stdio, optional HTTP, ReAct-цикл и native recovery tools. Capabilities (файлы, shell, git…) — через MCP. Память/RAG, ensemble, skills, monitor — опциональные extras.

Нет. При установленном extra [memory] поиск строится на BM25 и индексе Markdown-файлов без Pinecone, Weaviate и других vector DB. Hybrid-режим с локальными embeddings опционален.

В ядре: DirectoryGuard для путей Core, ApprovalGate для MCP-tools с requires_approval, валидация схем. Изоляция shell/FS — ответственность MCP-серверов, которые вы подключаете в mcp.json.

Да. Любые GGUF, совместимые с вашей сборкой llama-server (облачные LLM-провайдеры не поддерживаются). Агенты и промпты — через YAML; capabilities — через MCP. См. точки расширения и MCP.

Да. Desktop-клиент для Windows ставит окружение через мастер настройки и общается с ядром по stdio. Linux и macOS появятся позже. Для своей оболочки используйте local-ai serve-stdio.

Большинству пользователей достаточно скачать desktop для Windows. Для ядра: зависимости, config.yaml и local-ai cli — в документации; исходный код — на GitLab. Проблемы — через форму отчёта.

Разработчикам, которым нужен локальный LevPRO AI runtime без LangChain; командам с требованиями к приватности инференса; тем, кто собирает ассистентов в периметре и подключает свои tools через MCP.

Задать вопрос

Не нашли ответ выше? Напишите нам — ответим на e-mail в ближайшее время.

Нашли баг? Лучше отправить отчёт с логами и скриншотами.