План роста
Вы уже строите агентную платформу в продакшне. План закрывает четыре пробела за 8 недель на материале 1cifer: понимание своего харнесса, evals качества ответов, видимость работы, рыночная цена.
Таймлайн
Ромб — ворота в конце направления. Ритм — 6–8 часов в неделю, часть прямо в рабочих задачах. Разборы строятся на пробелах 1 и 2, собеседования — на разборах.
Четыре пробела
1. Объяснить свой харнесс без ИИ
Цель: на system design за 45 минут выложить архитектуру агентного харнесса и защитить каждое решение в 1cifer — без кода и без Claude под рукой. Материал: docs/chat-architecture.md, docs/harness-audit-2026-09.md.
Метод — одна подсистема в неделю
- Прочитать код самому, без агента. Нарисовать поток на бумаге.
- Одна страница своими словами: что делает, почему так, чем рискует, что бы сделали иначе.
- Попросить Claude не объяснить, а проэкзаменовать вас — или рассказать коллеге.
- Одна небольшая правка в этой подсистеме руками.
- Неделя 1 · жизненный цикл хода (
agentLoop,finalizeTurn, очередь headless)Какие четыре исхода у хода и как ход переживает deploy и eviction Durable Object? - Неделя 2 · кэш промптов и цена входаПочему волатильный преамбул стоит хвостом и почему запись в кэш — большая часть цены входа?
- Неделя 3 · контекст и память (compaction, чекпоинты, память v2)Что теряется при сжатии FACTS / FILES / OPEN и как вы это заметите?
- Неделя 4 · безопасность и HITL (
narrowToDeclared,[untrusted-content])Какую атаку закрывает сужение до названного инструмента и что остаётся открытым?
Чекпоинт 1
2. Evals качества ответов
Сейчас 46 сценариев в evals/scenarios.ts проверяют поведение: выбор инструмента, цепочку вызовов, факты по подстроке. Не измеряются точность векторного поиска по законам и качество самого ответа. Опыт разбора ошибок уже есть (docs/legal-corpus-llm-errors.md) — его нужно перенести на ответы агента.
Недели 3–4 — метрики поиска по законам
- Из логов 30–50 реальных запросов к инструментам законов; для каждого руками разметить правильные акты или статьи.
- Скрипт рядом с
evals/: прогон через тот же путь, чтоLawVectorFan, подсчёт recall@5 и recall@10. - Зафиксировать базовую линию. Дальше любая правка чанкинга или эмбеддингов — с числом «до → после».
Недели 5–6 — судья для ответов
- Error analysis: 50 продовых ходов, плохие разложить по типам. Самый частый тип — в сценарий по правилу E3.
- Для 10–15 сценариев с
expectFinal— рубрика (точность, полнота, нет выдумки) и LLM-as-judge в режиме advisory. - Сверить судью с собой на 20 ответах. Судья без сверки с человеком — ещё один источник шума.
CI-гейт не добавляем: владелец от него отказался 23.09, прогон остаётся ручным.
Чекпоинт 2
3. Сделать работу видимой
Цель: два опубликованных разбора, на которые можно сослаться в резюме и на собеседовании. Первый шаг — согласовать темы с компанией: без кода, клиентов и абсолютных цифр.
- Кэш промптов в агенте · chat-architecture.md, раздел 2Почему запись стоила больше чтения: цифры и три найденные причины промаха.
- Ошибки LLM при сопоставлении правовых актов · legal-corpus-llm-errors.mdГотовый error analysis на 11 шаблонов — то, чего не хватает большинству команд.
- Evals агента через свой прокси · evals/run.ts, правило E3Baseline, повторы, вердикт по большинству; после пробела 2 — с судьёй и recall@k.
- Проверка находок ИИ-ревью кодом · harness-audit-2026-09.mdМетодология аудита мультиагентным ревью с воспроизведением.
Как писать: 1500–2500 слов, «задача → что измерили → что нашли → что сделали → что осталось открытым». Черновик — сами (заодно проверка пробела 1), ИИ — только редактура. Хабр или личный блог плюс кросс-пост в LinkedIn и Telegram.
Чекпоинт 3
4. Узнать свою цену
Цель — решение о следующих 6 месяцах на реальных офферах и цифрах. Уходить не обязательно: собеседования здесь — измерительный инструмент.
- Резюме с результатами, а не стеком. «Спроектировал и веду агентный харнесс B2B-платформы: агентный цикл, HITL, compaction, MCP, evals через собственный LLM-прокси» + 1–2 строки с числами.
- Вилка рынка. 10–15 вакансий AI engineer / LLM engineer / product engineer с зарплатами, локально и удалённо.
- 2–3 собеседования. После каждого — вопросы, на которых плавали: это список для следующего круга пробела 1.
- Разговор в стартапе. С цифрами рынка и разборами — роль, зарплата, доля; на сколько месяцев у компании денег.
- Решение. Критерии: запас денег у стартапа, рост ответственности, разница в деньгах, подушка.
Чекпоинт 4
Ресурсы
- Харнесс · Anthropic, «Building Effective Agents» и статьи про context engineeringСравнить свои решения с общепринятыми и назвать отличия.
- Харнесс · Chip Huyen, «AI Engineering»Словарь и структура для system design интервью.
- Evals · Hamel Husain, статьи про error analysis и LLM-as-judgeМетод разметки и валидации судьи.
- Evals · Anthropic, «Contextual Retrieval»Как измерять и улучшать поиск по документам.
- Видимость · инженерные блоги Anthropic, Vercel, CloudflareОбразец формата «задача → замер → решение».
- Рынок · вакансии и статистика зарплат по региону + удалённыеВилка и частые требования к роли.
Синхронизация
Отметки синхронизируются между устройствами по секретной ссылке. Откройте её один раз на другом устройстве — его отметки заменятся общими. Не публикуйте ссылку: по ней можно менять ваш прогресс.