AI engineering · 1cifer · 12 окт — 6 дек 2026

План роста

Вы уже строите агентную платформу в продакшне. План закрывает четыре пробела за 8 недель на материале 1cifer: понимание своего харнесса, evals качества ответов, видимость работы, рыночная цена.

Чекпоинты0 из 0

Таймлайн

Харнесс без ИИ нед. 1–4
Evals качества нед. 3–6
Публичные разборы нед. 4–8
Рынок и резюме нед. 6–8
Решение 6 дек

Ромб — ворота в конце направления. Ритм — 6–8 часов в неделю, часть прямо в рабочих задачах. Разборы строятся на пробелах 1 и 2, собеседования — на разборах.

Четыре пробела

1. Объяснить свой харнесс без ИИ

Недели 1–4

Цель: на system design за 45 минут выложить архитектуру агентного харнесса и защитить каждое решение в 1cifer — без кода и без Claude под рукой. Материал: docs/chat-architecture.md, docs/harness-audit-2026-09.md.

Метод — одна подсистема в неделю

  1. Прочитать код самому, без агента. Нарисовать поток на бумаге.
  2. Одна страница своими словами: что делает, почему так, чем рискует, что бы сделали иначе.
  3. Попросить Claude не объяснить, а проэкзаменовать вас — или рассказать коллеге.
  4. Одна небольшая правка в этой подсистеме руками.
  • Неделя 1 · жизненный цикл хода (agentLoop, finalizeTurn, очередь headless)Какие четыре исхода у хода и как ход переживает deploy и eviction Durable Object?
  • Неделя 2 · кэш промптов и цена входаПочему волатильный преамбул стоит хвостом и почему запись в кэш — большая часть цены входа?
  • Неделя 3 · контекст и память (compaction, чекпоинты, память v2)Что теряется при сжатии FACTS / FILES / OPEN и как вы это заметите?
  • Неделя 4 · безопасность и HITL (narrowToDeclared, [untrusted-content])Какую атаку закрывает сужение до названного инструмента и что остаётся открытым?

Чекпоинт 1

2. Evals качества ответов

Недели 3–6

Сейчас 46 сценариев в evals/scenarios.ts проверяют поведение: выбор инструмента, цепочку вызовов, факты по подстроке. Не измеряются точность векторного поиска по законам и качество самого ответа. Опыт разбора ошибок уже есть (docs/legal-corpus-llm-errors.md) — его нужно перенести на ответы агента.

Недели 3–4 — метрики поиска по законам

  1. Из логов 30–50 реальных запросов к инструментам законов; для каждого руками разметить правильные акты или статьи.
  2. Скрипт рядом с evals/: прогон через тот же путь, что LawVectorFan, подсчёт recall@5 и recall@10.
  3. Зафиксировать базовую линию. Дальше любая правка чанкинга или эмбеддингов — с числом «до → после».

Недели 5–6 — судья для ответов

  1. Error analysis: 50 продовых ходов, плохие разложить по типам. Самый частый тип — в сценарий по правилу E3.
  2. Для 10–15 сценариев с expectFinal — рубрика (точность, полнота, нет выдумки) и LLM-as-judge в режиме advisory.
  3. Сверить судью с собой на 20 ответах. Судья без сверки с человеком — ещё один источник шума.

CI-гейт не добавляем: владелец от него отказался 23.09, прогон остаётся ручным.

Чекпоинт 2

3. Сделать работу видимой

Недели 4–8

Цель: два опубликованных разбора, на которые можно сослаться в резюме и на собеседовании. Первый шаг — согласовать темы с компанией: без кода, клиентов и абсолютных цифр.

  • Кэш промптов в агенте · chat-architecture.md, раздел 2Почему запись стоила больше чтения: цифры и три найденные причины промаха.
  • Ошибки LLM при сопоставлении правовых актов · legal-corpus-llm-errors.mdГотовый error analysis на 11 шаблонов — то, чего не хватает большинству команд.
  • Evals агента через свой прокси · evals/run.ts, правило E3Baseline, повторы, вердикт по большинству; после пробела 2 — с судьёй и recall@k.
  • Проверка находок ИИ-ревью кодом · harness-audit-2026-09.mdМетодология аудита мультиагентным ревью с воспроизведением.

Как писать: 1500–2500 слов, «задача → что измерили → что нашли → что сделали → что осталось открытым». Черновик — сами (заодно проверка пробела 1), ИИ — только редактура. Хабр или личный блог плюс кросс-пост в LinkedIn и Telegram.

Чекпоинт 3

4. Узнать свою цену

Недели 6–8

Цель — решение о следующих 6 месяцах на реальных офферах и цифрах. Уходить не обязательно: собеседования здесь — измерительный инструмент.

  1. Резюме с результатами, а не стеком. «Спроектировал и веду агентный харнесс B2B-платформы: агентный цикл, HITL, compaction, MCP, evals через собственный LLM-прокси» + 1–2 строки с числами.
  2. Вилка рынка. 10–15 вакансий AI engineer / LLM engineer / product engineer с зарплатами, локально и удалённо.
  3. 2–3 собеседования. После каждого — вопросы, на которых плавали: это список для следующего круга пробела 1.
  4. Разговор в стартапе. С цифрами рынка и разборами — роль, зарплата, доля; на сколько месяцев у компании денег.
  5. Решение. Критерии: запас денег у стартапа, рост ответственности, разница в деньгах, подушка.

Чекпоинт 4

Ресурсы

Синхронизация

Отметки синхронизируются между устройствами по секретной ссылке. Откройте её один раз на другом устройстве — его отметки заменятся общими. Не публикуйте ссылку: по ней можно менять ваш прогресс.