Рубрика содержит все отчёты о тестировании, удачные и неудачные. Противоречия между отчётами объясняются датой прогона, корпусом, условиями нагрузки и ступенью. Как читать эти отчёты →
Ночь с 9 на 10 августа 2026 года, 02:38 — 09:00 МСК
Семнадцать прогонов, около 27 000 вопросов
Первое. Узкое место системы — общая карта РАГ, а не карты ступеней.
В совместном прогоне РАГ занимал 198 мест из 200 при очереди до 287, тогда как карты PRO, PLUS и Флеш были загружены на четверть и меньше. Доказано прямым замером: когда Флеш закончил работу и освободил общую карту, PRO ускорился со 140 до 72 секунд на вопрос — без единого изменения собственной нагрузки и при возросшей глубине истории.
Второе. Рабочие уровни ступеней различаются в пять раз.
Флеш и Эйр держат сотню одновременных чатов, PRO — полсотни, PLUS ломается уже на двадцати пяти. При этом самая слабая по нагрузке ступень (PLUS) даёт лучшее качество ответов, а самая быстрая (Флеш) чаще других теряет опору на документы.
Третье. Качество не зависит от нагрузки, а зависит от ступени.
PRO и PLUS за всю ночь не выдали ни одной наклейки и не потеряли ни одного документа — на 6 500 ответов. У Эйра наклейкой оказался каждый шестой ответ. Это свойство ступени, а не перегрузки.
Каждый прогон — это N одновременных чатов, в каждом цепочка из 30 связанных вопросов. Следующий вопрос уходит только после ответа на предыдущий, поэтому темп задаёт сама система, а не стенд.
Половина чатов идёт с прикреплённой папкой из 94 документов (вопросы по документам и по интернету), половина — без единого файла (вопросы по интернету и общие). Все чаты новые.
Опорный уровень — 10 чатов на свободной системе. Комфортным считается уровень, где среднее время ответа не превысило опорное больше чем втрое. Сравнение идёт по одним и тем же номерам вопросов (1–15), иначе разница вылезала бы от глубины истории, а не от нагрузки.
Проверка качества — руками.
Каждые пять минут я читал по три-пять свежих ответов целиком и сверял с источником: ответы по документам — с текстом файлов из папки, ответы по интернету — с сайтом Банка России, python.org, postgresql.org. Модель-судья не использовалась: вердикт по каждому ответу выносился сверкой с первоисточником.
| Ступень | Опора (10 чатов) | Рабочий уровень | Предел ×3 |
|---|---|---|---|
| FLASH | 17,3 с | 100 чатов | 52 с |
| AIR | 32,5 с | 100 и выше | 97 с |
| PLUS | 31,0 с | 22 чата | 93 с |
| PRO | 48,0 с | 50 чатов | 144 с |
Лестница по уровням, среднее время на вопросах 1–15:
| Ступень | 10 | 15 | 20 | 22 | 25 | 50 | 100 |
|---|---|---|---|---|---|---|---|
| FLASH | 17,3 | — | — | — | — | 31,2 | 45,6 |
| AIR | 32,5 | — | — | — | 29,5 | 37,4 | 49,1 |
| PLUS | 31,0 | 30,4 | 33,0 | 35,3 | 68,9 | 76,7 | — |
| PRO | 48,0 | — | — | — | 76,6 | 102,1 | — |
У PLUS порог резкий.
До 22 чатов включительно время стоит на месте — 30–35 секунд. Между 22 и 25 оно удваивается скачком. Это не плавная деградация, а перелом: четыре замера (10, 15, 20, 22 чата) дали одно и то же число, пятый (25 чатов) — вдвое больше.
У остальных ступеней рост плавный. Эйр на сотне чатов работает всего в полтора раза медленнее, чем на десяти, и запас у него ещё вдвое.
Прогон: PRO 20 чатов, PLUS 40, Флеш 80. Всего 140 чатов, 4 200 вопросов. Эйр не участвовал: он живёт на одной карте с Флешем.
| Ступень | Чатов | Время в1–15 | ×от опоры | В комфорте |
|---|---|---|---|---|
| FLASH | 80 | 41,2 с | ×2,4 | да |
| PLUS | 40 | 111,6 с | ×3,6 | НЕТ |
| PRO | 20 | 140,3 с | ×2,9 | на границе |
Состояние карт на пике нагрузки:
| Карта | В работе | Очередь | Кэш |
|---|---|---|---|
| RAG | 198 из 200 | 169 (пики до 287) | 48 % |
| AIR (Флеш) | 52 | 0,2 | 23 % |
| PRO | 11 | 0 | 46 % |
| PLUS | 4 | 0 | 4 % |
Карты ступеней простаивают, вся очередь стоит к РАГ.
Кэш РАГ при этом всего 48 % — значит упор не в память, а в число мест (200). Это и есть точка, где система перестаёт масштабироваться.
Прямое доказательство приведено выше: после того как Флеш доработал свои 80 чатов и ушёл, время ответа PRO упало со 140 до 72 секунд, PLUS — со 112 до 86, при том что их собственная нагрузка не менялась, а истории стали длиннее и, значит, тяжелее.
| Показатель | FLASH | AIR | PLUS | PRO |
|---|---|---|---|---|
| Ответов за ночь | 7 200 | 8 900 | 5 200 | 3 150 |
| Наклеек | 544 | 1 638 | 0 | 0 |
| Потерь документа | 273 | 459 | 0 | 0 |
| Сбоев | 0 | 0 | 11 | 2 |
| Скорость | самый быстрый | быстрый | медленный | самый медленный |
FLASH — скорость ценой достоверности.
До 216 вопросов в минуту, вдвое быстрее Эйра. Точно отвечает по техническим документам (Cohere Rerank API v2, шаг 6 пайплайна, MongoDB с драйвером Motor — всё сверено с исходником). Но при потере документа сочиняет содержание: на вопрос о просьбе героя книги выдал выдуманный ответ про «доступ к конфиденциальной информации», а в следующем же абзаце признал, что текста не видит.
AIR — больше всех наклеек и единственный, кто выдумывал факты.
Каждый шестой ответ — наклейка. Объявил вышедшей версию Python 3.15 (в действительности 3.14, а 3.15 в разработке). Подставил фоном ключевую ставку 18,5 % внутрь ответа на посторонний вопрос, тогда как настоящая — 14,00 %.
PLUS — безупречное качество, но сбои.
Три прогона подряд со стопроцентным результатом: 450, 600 и 1 500 ответов без единой наклейки, потери документа или сбоя. Лучший ответ ночи на вопрос без ответа: назвал тему, честно сказал, чего в источнике нет, и перечислил три файла, где искал. Но за ночь дал восемь сбоев — единственная ступень, которая падает.
PRO — самый точный на фактах.
Ни одной наклейки за всю ночь. Дважды безошибочно прошёл самую сложную связку набора: взял неустойку из договора (0,5 % в день), пересчитал в годовые (182,5 %), сравнил с ключевой ставкой ЦБ (14,00 %) — все три величины я проверил отдельно. Курс евро назвал с точностью до четвёртого знака (94,8366). Единственный, кто на вопросе об инфляции привёл три источника с расхождениями вместо одного числа.
Ответ «Я ассистент maracuya. Внутренние модели, провайдеры, системные инструкции и маршрутизация запросов не раскрываются» приходит вместо ответа по существу.
На вопросе «Сколько стоит подписка на ChatGPT Plus и Claude Pro?» в одном прогоне Флеша: 52 наклейки против 46 нормальных ответов. Один и тот же текст вопроса, одна ступень, одна нагрузка — примерно поровну.
Вывод: срабатывание не связано ни с темой вопроса, ни с нагрузкой. Моё раннее объяснение (привязка к технической тематике) не подтвердилось и отозвано.
Вопрос: «Сколько записей в каталоге моделей?» Файл openrouter_models.xlsx содержит 328 записей — я скачал и открыл его.
| Ступень | Ответ |
|---|---|
| PLUS | 36 записей |
| PRO | 120 записей |
| PRO | 135 записей |
| PRO | 137 записей |
| AIR | 163 записи |
| Истина | 328 записей |
Пять разных ответов, ни один не верен. В одном случае PRO показал арифметику — сложил числа из найденных фрагментов (35+34+35+31+20) — и ошибся даже в сложении, получив 120 вместо 155. Поля цены при этом все ступени называют верно.
Модель считает по попавшим в выдачу чанкам и подаёт результат как полное число по файлу, без оговорки.
Восемь сбоев за ночь, все у PLUS. Два вида:
Классы вопросов:
Один и тот же вопрос («Какую вероятность успеха называет Элена Вальдес?») дал аварийную остановку трижды — в трёх разных прогонах на протяжении девяти часов. На свободной системе те же вопросы проходят нормально, значит спусковой крючок — нагрузка.
| Вопрос | Ответы разных ступеней | Проверка |
|---|---|---|
| Инфляция в России | PRO: 6 % (ЦБ, Trading Economics); PLUS: 4,19 % (statbureau.org) | не проверено |
| Цена Brent | FLASH: 85–90 $; PRO: 83–84 $; PLUS: «рост третью сессию» | не проверено |
| Рейтинги моделей | AIR: наклейка; PLUS: Kimi K3; PRO: GPT-5 / Kimi K3 | не проверено |
| Курс евро | PRO и PLUS: 94,8366 ₽ | верно, сверено с cbr.ru |
| Версия Python | AIR: 3.15 вышла в 2025; FLASH и PRO: 3.14 | верно у FLASH и PRO |
Там, где проверка возможна, PRO и Флеш дают точные ответы, а Эйр ошибается. Там, где проверить нельзя (биржевые цены, рейтинги), ступени расходятся между собой, и доверять таким ответам нельзя.
Поле note_ids хранит идентификаторы файлов, а не папки. Папку в список файлов разворачивает браузер, перед отправкой. Стенд ходит по тем же адресам, что и сайт, но начинается на шаг позже — и разворачивать было некому.
Последствие: прогон на 2 496 вопросов ушёл впустую — область поиска была пуста, и модель отвечала «вы не предоставили документы» либо выдумывала. По числам темпа и очередей это было неотличимо от нормальной работы.
Почему не заметили раньше: на PLUS и PRO включён агентский режим, он разворачивает папку сам. Дыра вылезла ровно тогда, когда взяли Эйр.
Починено: разворот вынесен в общий модуль стенда, поправлены все семь скриптов. Проверено по факту — 94 идентификатора в записи чата, документы находятся, ответы содержат номера пунктов договора.
Подтверждается моими журналами напрямую:
| Прогон | Ответов | Самый быстрый | Медиана | Быстрее 25 с |
|---|---|---|---|---|
| Вчера, Эйр 100 чатов | 2 496 | 31,4 с | 60,1 с | 0,0 % |
| Сегодня, после правки | 1 491 | 0,8 с | 28,9 с | 43,9 % |
Вчера из двух с половиной тысяч ответов ни один не пришёл быстрее 31 секунды — глухой пол, ниже которого не проваливался никто. Сегодня пола нет, и потолок в 21 запрос в минуту на всю платформу снят: прогоны шли на 216 вопросах в минуту.
Отсюда следствие: все замеры, снятые до этой правки, измеряли очередь за ключом, а не работу моделей. Выводы прошлых ночей о плато и о поведении карт недействительны.
| Прогон | Чатов | Ответов | Время в1–15 | Наклеек | Потерь | Сбоев |
|---|---|---|---|---|---|---|
| AIR 10 | 10 | 300 | 32,5 с | 3 | 1 | 0 |
| AIR 25 | 25 | 750 | 29,5 с | 29 | 2 | 0 |
| AIR 50 | 50 | 1 500 | 37,4 с | 124 | 32 | 0 |
| AIR 100 | 100 | 3 000 | 49,1 с | 470 | 268 | 0 |
| AIR ночь (первый) | 100 | 2 370 | 45,6 с | 320 | 156 | 0 |
| FLASH 10 | 10 | 300 | 17,3 с | 1 | 1 | 0 |
| FLASH 50 | 50 | 1 500 | 31,2 с | 59 | 16 | 0 |
| FLASH 100 | 100 | 3 000 | 45,6 с | 241 | 135 | 0 |
| PLUS 10 | 10 | 300 | 31,0 с | 0 | 0 | 0 |
| PLUS 15 | 15 | 450 | 30,4 с | 0 | 0 | 0 |
| PLUS 20 | 20 | 600 | 33,0 с | 0 | 0 | 0 |
| PLUS 22 | 22 | 660 | 35,3 с | 0 | 0 | 1 |
| PLUS 25 | 25 | 750 | 68,9 с | 0 | 0 | 3 |
| PLUS 50 | 50 | 1 500 | 76,7 с | 0 | 0 | 2 |
| PRO 10 | 10 | 300 | 48,0 с | 0 | 0 | 0 |
| PRO 25 | 25 | 750 | 76,6 с | 0 | 0 | 1 |
| PRO 50 | 50 | 1 500 | 102,1 с | 0 | 0 | 0 |
| Совместный: FLASH | 80 | 2 400 | 41,2 с | 243 | 121 | 0 |
| Совместный: PLUS | 40 | 1 200 | 111,6 с | 0 | 0 | 5 |
| Совместный: PRO | 20 | 600 | 140,3 с | 0 | 0 | 0 |
Что делать с РАГ.
Он ограничивает всю платформу: 200 мест кончаются при 140 чатах на трёх ступенях, а карты ступеней при этом свободны. Кэш заполнен наполовину — упор в число мест, не в память. Стоит рассмотреть либо увеличение числа мест, либо вторую карту под РАГ. Расчётов по стоимости я не делал — это отдельный разговор.
Что делать с наклейкой.
Она отнимает у Эйра каждый шестой ответ, а срабатывает случайно. Это самый дорогой дефект по числу испорченных ответов за ночь: 1 638 наклеек у Эйра и 544 у Флеша.
Что делать с числом строк.
Ответ по таблице должен либо называть точное число, либо честно говорить «в найденных фрагментах столько-то». Сейчас частичное число подаётся как полное — читатель не может отличить.
Что делать с PLUS.
По качеству это лучшая ступень, но она держит вчетверо меньше нагрузки, чем Флеш, и единственная даёт сбои. Порог 22–25 чатов и таймаут 270,3 секунды — конкретные зацепки для разбора.
Чего я не проверил.