РИС БЕНЧ что модели реально делают в прямом эфире
▶ Лидерборд моделей
▶ Бэклог и идеи комьюнити
▶ Опросы вайбкодеров
▶ Методология и где бенч врёт
Что видно по корпусу
- Ваншот всё ещё бывает настоящим: Claude Fable 5 собрал онлайн-3D-шутер Dust Arena за 30 минут в эфире 004 — чат зашёл и играл. кейс
- «Дешёвая модель» — не про цену прогона: GLM 5.2 сжёг 83M токенов за два часа, 27% недельного лимита против ~5% у Codex. кейс
- Единственный чистый кросс-модельный A/B — аквариум: один сид прошёл 016 → 015 → 018 → 019, по вайбу победил Kimi K3. кейс
- Провал в простом не предсказывает провала в сложном: GPT-5.6 не вытянул солнечную систему, но в том же эфире 011 поднял Dust Arena v2. кейс
- Safety зависит от харнесса: GLM отказался собирать «серый» магазин в чате, но собрал его в AI-builder Z.ai. кейс
Статус сида и вердикты
verbatim — дословный текст промпта сохранён.
normalized — текст причёсан, смысл не менялся.
reconstruction — восстановлен по эфиру, сравнивать с осторожностью.
Вердикты выведены из живых оценок вслух по словам-маркерам: «провал / шляпа» → фейл, «условно / ничья / загрязнение» → смешанно, «успех / ваншот / работает» → пас.
Индекс и честный A/B
Индекс = (пас + 0,5 · смешанно) ÷ (пас + смешанно + фейл). Прогоны без оценки в индекс не входят.
- freeze inputs: один и тот же сид, без правок между моделями
- харнесс фиксируется рядом с моделью — «модель + харнесс = агент»
- у субагентов пишется их собственный model id, а не id оркестратора
- вмешался скилл — прогон помечается как загрязнённый
- ссылки на демо проверяются по содержимому: поддомены переиспользуются за часы
Где этот бенч врёт
- Один прогон на кейс. В среднем 1,1 прогона на тест — это анекдот, а не выборка.
- Я сам выбираю задачи — пул смещён в сторону того, что интересно показать в эфире.
- Я сам сужу. Слепого судейства нет, answer key есть ровно у одного запланированного теста.
- Часть замеров загрязнена скиллами харнесса — мерили связку «модель + скилл».
- Вердикт снимается один раз, вживую, без повторов и прогонов на температуре.
Строгий community-бенч со слепым судейством — отдельный проект: corp-community#20.