Всего прогонов
0
Типов прогонов
0
Feedback-кейсов
0
Диалогов (всего)
0
One-click runbook ?
Быстрые operator-проверки для качества ответов без ручного поиска нужной секции ниже.
Кнопки предзаполняют нужные параметры и запускают существующие проверки через те же API, что и основной workbench.
Операторские маршруты ?
Короткий путь от triage к разбору и запуску нужной проверки.
Последние quality-сигналы ?
Последние результаты stability, conversation stability и dimension scorecards без запуска дополнительных проверок.
Загрузка…
Последние snapshot diff ?
Быстрый обзор изменений между двумя последними baseline snapshot без ручного сравнения.
Загрузка…
Последние production-проблемы ?
Сводка по реальным проблемным ответам: taxonomy из production feedback и активные manual review кейсы.
Загрузка…
Последние regression candidates ?
Ближайшие production-кейсы для переноса в регрессию: что можно сохранить автоматически и что требует ручной доработки.
Загрузка…
Последние promoted кейсы ?
Недавно сохранённые production-кейсы в библиотеке регрессии. Это показывает, что feedback loop реально доходит до reusable regression-cases.
Загрузка…
Queue pressure ?
Операционная нагрузка quality-потока: сколько кейсов ждут review, promotion и сколько уже закрыто.
Загрузка…
Trend ?
Короткая динамика между двумя последними snapshot: растёт ли manual review, production feedback и меняется ли общий статус baseline.
Загрузка…
Action hints ?
Следующие лучшие действия по текущему состоянию качества: review, promote, source purity или baseline drill-down.
Загрузка…
Top failing slices ?
Где именно сейчас концентрируется quality-риск: товарные семьи и группы запросов.
Загрузка…
Top flaky cases ?
Наиболее нестабильные кейсы из последних stability и conversation stability прогонов.
Загрузка…
Top missing facts ?
Кейсы из fact coverage, где ответ чаще всего недоговаривает подтверждённые характеристики товара.
Загрузка…
Top weak answer checks ?
Самые слабые кейсы из answer-layer eval: где финальный ответ чаще всего не проходит assertions или даёт пограничную формулировку.
Загрузка…
Top weak follow-up chains ?
Самые слабые multi-turn suites: где follow-up слой нестабилен, дрейфует по переходам или даёт скрытую деградацию между репликами.
Загрузка…
Top cross-domain follow-up switches ?
Самые важные переключения между `catalog` и `docs`: видно, где follow-up был anchor-enriched, а где переключение прошло без явной привязки к предыдущему ходу.
Загрузка…
Top polluted sources ?
Кейсы, где trace уже показывает загрязнение источников: чужие family в top sources, foreign sources или неудачный top-source family.
Загрузка…
Top routing mismatches ?
Кейсы, где preferred и used mode расходятся или routing выглядит нетривиально. Это полезно для отлова скрытых пограничных маршрутов до явной деградации.
Загрузка…
Top expensive cases ?
Самые дорогие и медленные кейсы из последних synthetic прогонов. Это помогает видеть, где качество уже нормальное, но эксплуатационная цена и latency слишком высоки.
Загрузка…
Top slow cases ?
Самые медленные synthetic-кейсы из последних прогонов. Это отдельный слой от стоимости: здесь важна именно latency ответа.
Загрузка…
Top inconsistent greetings / style drift ?
Кейсы, где тон, приветствие или форма ответа заметно варьируются между повторами. Это отдельный stylistic-срез, не смешанный с фактологией и retrieval.
Загрузка…
Top no-hit risks ?
Пограничные кейсы, где ответ ещё существует, но уже видны признаки слабого retrieval, fallback или приближения к нежелательному no-hit сценарию.
Загрузка…
Top fallback-heavy cases ?
Кейсы, где итоговый ответ живёт за счёт fallback, route shift или вторичного retrieval. Это позволяет отличать устойчивое качество от случайно спасённого результата.
Загрузка…
Top thin-context cases ?
Кейсы, где ответ проходит, но опирается на слишком бедный контекст: мало источников, мало preview и узкий retrieval window. Это ранний сигнал хрупкости ответа.
Загрузка…
Top unstable docs-intent cases ?
Пограничные document-intent кейсы, где docs routing, follow-up или retrieval по документам выглядят нестабильно либо слишком чувствительно к route shift.
Загрузка…
Top suspicious exact-code cases ?
Exact-code запросы, которые формально проходят, но выглядят подозрительно: route shift, бедный retrieval, лишний fallback или нестрогое exact-first поведение.
Загрузка…
Top ambiguous family cases ?
Кейсы, где retrieval уже видит несколько family одновременно и ответ становится чувствительным к расширению каталога или изменению ранжирования.
Загрузка…
Top weak document evidence cases ?
Document-RAG кейсы, где docs routing уже выбран правильно, но доказательная база по документам остаётся слишком тонкой: мало источников, короткий ответ или сдвиг к fallback.
Загрузка…
Top silent regressions ?
Кейсы, которые ещё проходят, но уже накапливают несколько слабых сигналов одновременно: thin context, route shift, style drift, weak evidence, foreign sources или высокий fallback-risk.
Загрузка…
Top risky follow-up transitions ?
Самые рискованные переходы между репликами в multi-turn сценариях: route shift, смена family, переход между docs и catalog или хрупкий короткий follow-up после exact-match ответа.
Загрузка…
Top recovery wins ?
Кейсы, где система проходит через потенциально рискованный переход, но всё же корректно восстанавливается: удерживает family, очищает источники и даёт правильный ответ без деградации.
Загрузка…
Top brittle exact-followups ?
Короткие follow-up после exact-code запроса, которые ещё проходят, но уже выглядят хрупко: route shift, thin retrieval, foreign sources или trace anomalies там, где ожидается простой anchored catalog follow-up.
Загрузка…
Top cross-domain switches ?
Переходы между `catalog` и `docs` в multi-turn сценариях. Это отдельный срез для контроля самого опасного класса mixed-domain ошибок.
Загрузка…
Top low-ROI cases ?
Кейсы, которые стоят дорого по времени или цене, но уже несут слабые сигналы качества. Это лучший список для следующего цикла оптимизации.
Загрузка…
Экспорт качества
Быстрая выгрузка истории прогонов и архивов review в JSON или Markdown
Quality snapshots ?
Сохраняйте именованные baseline-снимки качества и сравнивайте их после изменений retrieval, prompt и runtime.
Пока не запускалось.
Загрузка…
Baseline capture ?
Fast baseline для частых правок: только быстрые ключевые проверки. Quick/full — расширенные baseline для более тяжёлых изменений. Snapshot сохраняется автоматически после прогона.
Пока не запускалось.
Полный quality matrix ?
Один боевой запуск для routing, retrieval, final answer, hard-query packs и многошаговых suites.
Пока не запускалось.
Stability runner
Повторяет одни и те же кейсы несколько раз и показывает нестабильность формулировки, retrieval mode и source_count.
Пока не запускалось.
Fact coverage
Сравнивает ответ с top source и считает, сколько подтверждённых фактов из карточки товара реально попало в ответ.
Пока не запускалось.
Conversation stability
Повторяет многошаговые suites и показывает, дрейфует ли follow-up поведение, режимы retrieval и чистота якорного контекста.
Пока не запускалось.
Dimension scorecards
Сводка по измерениям качества: correctness, stability, fact coverage, source purity и follow-up quality.
Пока не запускалось.
История прогонов
Загрузка…
Прогоны по типу провала
Быстрый срез последних eval-прогонов по конкретной причине деградации
Пока не запускалось.
Production-очередь по таксономии ?
Реальные оценённые ответы пользователей, автоматически сгруппированные по типу проблемы
Загрузка…
Очередь проблемных ответов
Проблемные ответы из реальных диалогов
Загрузка…
Manual Review ?
Кейсы, которые нельзя автоматически сохранить в регрессию и нужно разбирать вручную
Загрузка…
Resolved Manual Review ?
Архив уже разобранных кейсов manual review: кто закрыл, когда и с какой пометкой
Загрузка…
Сводные scorecards по слоям
Пока не запускалось.
Forensics по слоям
Группы запросов и первые провалы по routing, retrieval и final answer
Пока не запускалось.
Семейные scorecards
Пока не запускалось.
Студия тест-кейсов ?
Ручной запуск и сохранение сложных кейсов
Сохранённые кейсы
Сохранённых кейсов пока нет.
Запуск query-pack
Поднабор golden queries по семейству и типу
Пока не запускалось.
Hard query pack
Отдельные тяжёлые наборы запросов: typo, mixed alphabet, no-hit, document intent
Пока не запускалось.
Быстрые live-метрики
Пока не загружено.
Synthetic scenario batch
Пакетный прогон произвольных live-сценариев через реальный generate_answer для проверки latency, modes, cost и ошибок.
Пока не запускалось.
Conversation suites
Многошаговые synthetic-диалоги для проверки follow-up, удержания контекста и смены retrieval mode между репликами.
Пока не запускалось.
Сравнение прогонов и drift
Пока не загружено.
Результат студии тест-кейсов
Пока нет результатов.
Сырой JSON
{}