🟢 Live · GPT × Claude mirror loop · Telegram-first

SelfevolveMirror

Не chain з обіцянками. Не лінійний агент. Просто mirror loop: GPT і Claude перевіряють один одного, ти бачиш чесний фінал — з артефактами на кожному кроці.

Старт у Telegram → Що всередині

Що робить SelfevolveMirror

Дев'ять самостійних модулів, що працюють разом як одна керована система — без хаотичних чатів і без auto-merge.

🪞

Mirror loop

GPT пише spec → Claude робить план → GPT критикує план → Claude реалізує (опційно) → GPT валідує → GPT синтезує фінал. Кожна стадія перевіряється другим агентом.

🧠

Clarification Gate

Адаптивно 0–7 high-leverage decision-питань перед стартом. Кожне питання — options + recommended default + why it matters. Якщо запит ясний — питань нуль.

📋

Technical spec

Objective, scope, non-scope, architecture, data model, integrations, security, acceptance criteria, phases, risks, assumptions — у JSON-валідованому форматі.

🔍

Self-critique

Spec critic знаходить missing decisions, ambiguities, overengineering. Plan critic — coverage. QA review — final quality + acceptance status.

🛠

Claude runner

Plan + implementation backends (SDK / CLI / fake). Implementation mode — sandboxed, max-turns, max-budget USD, off за замовчуванням.

📊

Live progress bar

12-block Unicode-bar у Telegram редагується на кожному переході стадій + ETA в секундах. У dashboard auto-refresh кожні 4с.

🗂

Artifact archive

input, clarity_analysis, technical_spec, critique, plan, diff, qa_review, final_report — все persistено в Postgres + диск, з SHA256 hash на кожному.

🌅

Daily optimizer

03:00 Europe/Sofia. Аналізує jobs за 24h, кластерує failure patterns, пропонує memory updates + prompt candidates. Telegram-digest з [Approve / Reject].

🔐

Approval gates

Memory + prompt changes — propose-only. Жодного auto-merge чи auto-deploy. Кнопки [Approve memory] / [Reject] — все під твоїм контролем.

5+GPT-стадій per job
3Claude backends
18job states tracked
~30send-to-end

Як це працює

Жодних setup'ів. Жодних API-ключів від тебе. Просто старт у Telegram.

Запусти бот

Натисни Start у @SelfevolveMirror_bot. Якщо ID у allowlist — одразу authorized. Інакше /claim <secret>.

/mirror <task>

Standard mode = до 5 питань. /fast = до 2 + більше assumptions. /deep = до 7 + детальніша specification.

Відповідай або defaults

Текстом: 1A, 2 default, 3B. Або тапай [Use defaults] — система прийме всі рекомендовані дефолти.

Approve · Revise · Remember

Фінальний звіт + кнопки. Approve — підтверджуєш. Revise — виправити. Remember — зберегти патерн у memory для майбутніх jobs.

Pipeline

Один job — одна послідовність артефактів. Жодного агента поза цією схемою.

UserGPT Clarification Gate → questions or proceed ↓ User → answers / Use defaults ↓ GPT → Technical Spec v1 ↓ GPT → Spec Critique → optional rewrite (Spec v2) ↓ Claude → Implementation Plan ↓ GPT → Plan Critique ↓ Claude → Implementation Report (optional, sandboxed) ↓ GPT → QA Review → optional repair loop ↓ GPT → Final Synthesizer ↓ User → Approve / Revise / Remember

Команди

Усі команди працюють у приватному чаті з ботом. <аргумент> — обов'язковий, [опційно] — додатковий.

/start

Привітання. Якщо ти у ADMIN_TELEGRAM_IDS — одразу authorized. Інакше — підказка про /claim.

/help

Повний перелік команд із короткими підказками.

/whoami

Твій Telegram ID, username і статус авторизації. Для адмінів — підтверджена сесія.

/claim <secret>

Bootstrap-захоплення першого admin-доступу. Secret береться з ENV BOOTSTRAP_SECRET на сервері. Після claim — секрет варто скинути.

/mirror <request>

Standard-режим. Створює job, запускає Clarification Gate (до 5 питань). Дефолтний вибір для більшості задач.

/fast <request>

Fast-режим. До 2 питань. Більше assumptions, швидший фінал. Для простих задач.

/deep <request>

Deep-режим. До 7 питань. Детальніша specification + плани. Для архітектурних чи production-задач.

/jobs

Останні 20 завдань: short_id, статус, mode, час створення. Клік у dashboard → деталі.

/status <short_id>

Стан конкретного job + перелік артефактів. Прогрес, поточна стадія, cost USD.

/daily

Запустити daily optimizer вручну. Поверне digest за 24h: failure patterns, memory updates, prompt candidates.

/settings

Поточні defaults: режим, max questions, Claude backend, прапорці planner / implementation.

Чому це не "ще один Telegram-бот"

Більшість агент-фреймворків — або chain з обіцянками, або один великий агент без аудиту. SelfevolveMirror — третій шлях.

🔁

Mirror, не chain

Один агент створює, інший критикує. GPT не довіряє Claude і навпаки. Кожна стадія має self-check, навіть якщо implementation-режим вимкнений.

🛡

Approval-by-default

Жодних auto-merge, auto-deploy, auto-prompt-changes. Memory updates — propose-only. Implementation mode — off за замовчуванням, sandboxed коли увімкнений.

🧬

Self-evolving prompts

Daily optimizer кластерує помилки за 24h, пропонує оновлення prompt-файлів і memory-rules. Ти approve — система застосовує. Ti reject — нічого не змінюється.

📜

Audit trail

Кожен job — повна папка артефактів від raw_request до final_report. SHA256 hash на кожному. У будь-який момент можна replay або порівняти версії.

Веб-дашборд та звіти

Telegram — основний інтерфейс. Але кожен job + щоденний optimizer мають web-перегляд із basic-auth доступом для авторизованих операторів.

📺

Live job board

/dashboard — список останніх jobs зі статусами, прогрес-баром і ETA. Auto-refresh кожні 4с. Клік → деталі: усі артефакти, hash, cost USD.

💵

Cost tracker

Кожен job логує витрати OpenAI + Anthropic у USD. cost_tracker агрегує по користувачу та режиму — видно в job detail і в daily digest.

📰

Daily HTML reports

/reports/daily — щоденний HTML-звіт оптимізатора: failure patterns, проміжний draft нових prompts/memory, проблемні jobs за останні 24h.

🔌

Internal JSON API

/api/jobs/{short_id}/progress повертає current stage + cost + ETA для зовнішнього моніторингу. Усі endpoints за basic-auth.

Стек і операції

Self-hosted на Hetzner. Без зовнішніх SaaS-залежностей окрім OpenAI + Anthropic API. Контейнери ізольовані per-project.

🐘

Postgres 17 + Redis 7

Основна БД для jobs / artifacts / users / memory rules / prompt versions. Redis — Celery broker + cache. Volumes persistено на диск.

⚙️

4 контейнери, docker-compose

api (FastAPI) · bot (python-telegram-bot, polling) · worker (Celery) · scheduler (Celery beat). Restart unless-stopped.

🌅

Daily optimizer 03:00 Sofia

Celery beat запускає daily_optimizer щоночі. Відсилає підсумок у Telegram з кнопками [Approve memory] / [Reject].

🗃

Artifact disk archive

Окрім Postgres, кожен artifact дублюється на диск як файл (input.txt, technical_spec.json, plan.md, qa_review.json, final_report.md) для replay і ad-hoc grep.

9самостійних модулів
11Telegram-команд
4running контейнери
03:00daily optimizer (Sofia)