← ко всем отчётамОтчёт 3

Ночные нагрузочные прогоны: все ступени

Рубрика содержит все отчёты о тестировании, удачные и неудачные. Противоречия между отчётами объясняются датой прогона, корпусом, условиями нагрузки и ступенью. Как читать эти отчёты →

Ночные нагрузочные прогоны Maracuya

Ночь с 9 на 10 августа 2026 года, 02:38 — 09:00 МСК

Семнадцать прогонов, около 27 000 вопросов

1. Главное в трёх пунктах

Первое. Узкое место системы — общая карта РАГ, а не карты ступеней.

В совместном прогоне РАГ занимал 198 мест из 200 при очереди до 287, тогда как карты PRO, PLUS и Флеш были загружены на четверть и меньше. Доказано прямым замером: когда Флеш закончил работу и освободил общую карту, PRO ускорился со 140 до 72 секунд на вопрос — без единого изменения собственной нагрузки и при возросшей глубине истории.

Второе. Рабочие уровни ступеней различаются в пять раз.

Флеш и Эйр держат сотню одновременных чатов, PRO — полсотни, PLUS ломается уже на двадцати пяти. При этом самая слабая по нагрузке ступень (PLUS) даёт лучшее качество ответов, а самая быстрая (Флеш) чаще других теряет опору на документы.

Третье. Качество не зависит от нагрузки, а зависит от ступени.

PRO и PLUS за всю ночь не выдали ни одной наклейки и не потеряли ни одного документа — на 6 500 ответов. У Эйра наклейкой оказался каждый шестой ответ. Это свойство ступени, а не перегрузки.

2. Как мерили

Каждый прогон — это N одновременных чатов, в каждом цепочка из 30 связанных вопросов. Следующий вопрос уходит только после ответа на предыдущий, поэтому темп задаёт сама система, а не стенд.

Половина чатов идёт с прикреплённой папкой из 94 документов (вопросы по документам и по интернету), половина — без единого файла (вопросы по интернету и общие). Все чаты новые.

Опорный уровень — 10 чатов на свободной системе. Комфортным считается уровень, где среднее время ответа не превысило опорное больше чем втрое. Сравнение идёт по одним и тем же номерам вопросов (1–15), иначе разница вылезала бы от глубины истории, а не от нагрузки.

Проверка качества — руками.

Каждые пять минут я читал по три-пять свежих ответов целиком и сверял с источником: ответы по документам — с текстом файлов из папки, ответы по интернету — с сайтом Банка России, python.org, postgresql.org. Модель-судья не использовалась: вердикт по каждому ответу выносился сверкой с первоисточником.

3. Рабочие уровни по ступеням

СтупеньОпора (10 чатов)Рабочий уровеньПредел ×3
FLASH17,3 с100 чатов52 с
AIR32,5 с100 и выше97 с
PLUS31,0 с22 чата93 с
PRO48,0 с50 чатов144 с

Лестница по уровням, среднее время на вопросах 1–15:

Ступень101520222550100
FLASH17,331,245,6
AIR32,529,537,449,1
PLUS31,030,433,035,368,976,7
PRO48,076,6102,1

У PLUS порог резкий.

До 22 чатов включительно время стоит на месте — 30–35 секунд. Между 22 и 25 оно удваивается скачком. Это не плавная деградация, а перелом: четыре замера (10, 15, 20, 22 чата) дали одно и то же число, пятый (25 чатов) — вдвое больше.

У остальных ступеней рост плавный. Эйр на сотне чатов работает всего в полтора раза медленнее, чем на десяти, и запас у него ещё вдвое.

4. Совместная работа ступеней

Прогон: PRO 20 чатов, PLUS 40, Флеш 80. Всего 140 чатов, 4 200 вопросов. Эйр не участвовал: он живёт на одной карте с Флешем.

СтупеньЧатовВремя в1–15×от опорыВ комфорте
FLASH8041,2 с×2,4да
PLUS40111,6 с×3,6НЕТ
PRO20140,3 с×2,9на границе

Состояние карт на пике нагрузки:

КартаВ работеОчередьКэш
RAG198 из 200169 (пики до 287)48 %
AIR (Флеш)520,223 %
PRO11046 %
PLUS404 %

Карты ступеней простаивают, вся очередь стоит к РАГ.

Кэш РАГ при этом всего 48 % — значит упор не в память, а в число мест (200). Это и есть точка, где система перестаёт масштабироваться.

Прямое доказательство приведено выше: после того как Флеш доработал свои 80 чатов и ушёл, время ответа PRO упало со 140 до 72 секунд, PLUS — со 112 до 86, при том что их собственная нагрузка не менялась, а истории стали длиннее и, значит, тяжелее.

5. Ступени различаются по качеству, а не только по скорости

ПоказательFLASHAIRPLUSPRO
Ответов за ночь7 2008 9005 2003 150
Наклеек5441 63800
Потерь документа27345900
Сбоев00112
Скоростьсамый быстрыйбыстрыймедленныйсамый медленный

FLASH — скорость ценой достоверности.

До 216 вопросов в минуту, вдвое быстрее Эйра. Точно отвечает по техническим документам (Cohere Rerank API v2, шаг 6 пайплайна, MongoDB с драйвером Motor — всё сверено с исходником). Но при потере документа сочиняет содержание: на вопрос о просьбе героя книги выдал выдуманный ответ про «доступ к конфиденциальной информации», а в следующем же абзаце признал, что текста не видит.

AIR — больше всех наклеек и единственный, кто выдумывал факты.

Каждый шестой ответ — наклейка. Объявил вышедшей версию Python 3.15 (в действительности 3.14, а 3.15 в разработке). Подставил фоном ключевую ставку 18,5 % внутрь ответа на посторонний вопрос, тогда как настоящая — 14,00 %.

PLUS — безупречное качество, но сбои.

Три прогона подряд со стопроцентным результатом: 450, 600 и 1 500 ответов без единой наклейки, потери документа или сбоя. Лучший ответ ночи на вопрос без ответа: назвал тему, честно сказал, чего в источнике нет, и перечислил три файла, где искал. Но за ночь дал восемь сбоев — единственная ступень, которая падает.

PRO — самый точный на фактах.

Ни одной наклейки за всю ночь. Дважды безошибочно прошёл самую сложную связку набора: взял неустойку из договора (0,5 % в день), пересчитал в годовые (182,5 %), сравнил с ключевой ставкой ЦБ (14,00 %) — все три величины я проверил отдельно. Курс евро назвал с точностью до четвёртого знака (94,8366). Единственный, кто на вопросе об инфляции привёл три источника с расхождениями вместо одного числа.

6. Найденные дефекты

6.1. Наклейка срабатывает случайно

Ответ «Я ассистент maracuya. Внутренние модели, провайдеры, системные инструкции и маршрутизация запросов не раскрываются» приходит вместо ответа по существу.

На вопросе «Сколько стоит подписка на ChatGPT Plus и Claude Pro?» в одном прогоне Флеша: 52 наклейки против 46 нормальных ответов. Один и тот же текст вопроса, одна ступень, одна нагрузка — примерно поровну.

Вывод: срабатывание не связано ни с темой вопроса, ни с нагрузкой. Моё раннее объяснение (привязка к технической тематике) не подтвердилось и отозвано.

6.2. Число строк в таблице считается по фрагментам выдачи

Вопрос: «Сколько записей в каталоге моделей?» Файл openrouter_models.xlsx содержит 328 записей — я скачал и открыл его.

СтупеньОтвет
PLUS36 записей
PRO120 записей
PRO135 записей
PRO137 записей
AIR163 записи
Истина328 записей

Пять разных ответов, ни один не верен. В одном случае PRO показал арифметику — сложил числа из найденных фрагментов (35+34+35+31+20) — и ошибся даже в сложении, получив 120 вместо 155. Поля цены при этом все ступени называют верно.

Модель считает по попавшим в выдачу чанкам и подаёт результат как полное число по файлу, без оговорки.

6.3. PLUS падает на двух классах вопросов

Восемь сбоев за ночь, все у PLUS. Два вида:

Классы вопросов:

Один и тот же вопрос («Какую вероятность успеха называет Элена Вальдес?») дал аварийную остановку трижды — в трёх разных прогонах на протяжении девяти часов. На свободной системе те же вопросы проходят нормально, значит спусковой крючок — нагрузка.

6.4. Расхождения в сетевых ответах между ступенями

ВопросОтветы разных ступенейПроверка
Инфляция в РоссииPRO: 6 % (ЦБ, Trading Economics); PLUS: 4,19 % (statbureau.org)не проверено
Цена BrentFLASH: 85–90 $; PRO: 83–84 $; PLUS: «рост третью сессию»не проверено
Рейтинги моделейAIR: наклейка; PLUS: Kimi K3; PRO: GPT-5 / Kimi K3не проверено
Курс евроPRO и PLUS: 94,8366 ₽верно, сверено с cbr.ru
Версия PythonAIR: 3.15 вышла в 2025; FLASH и PRO: 3.14верно у FLASH и PRO

Там, где проверка возможна, PRO и Флеш дают точные ответы, а Эйр ошибается. Там, где проверить нельзя (биржевые цены, рейтинги), ступени расходятся между собой, и доверять таким ответам нельзя.

6.5. Прочее

7. Что было сломано и починено за ночь

7.1. Стенд отправлял номер папки вместо файлов

Поле note_ids хранит идентификаторы файлов, а не папки. Папку в список файлов разворачивает браузер, перед отправкой. Стенд ходит по тем же адресам, что и сайт, но начинается на шаг позже — и разворачивать было некому.

Последствие: прогон на 2 496 вопросов ушёл впустую — область поиска была пуста, и модель отвечала «вы не предоставили документы» либо выдумывала. По числам темпа и очередей это было неотличимо от нормальной работы.

Почему не заметили раньше: на PLUS и PRO включён агентский режим, он разворачивает папку сам. Дыра вылезла ровно тогда, когда взяли Эйр.

Починено: разворот вынесен в общий модуль стенда, поправлены все семь скриптов. Проверено по факту — 94 идентификатора в записи чата, документы находятся, ответы содержат номера пунктов договора.

7.2. Тридцатисекундный шлагбаум (ваша находка про key-service)

Подтверждается моими журналами напрямую:

ПрогонОтветовСамый быстрыйМедианаБыстрее 25 с
Вчера, Эйр 100 чатов2 49631,4 с60,1 с0,0 %
Сегодня, после правки1 4910,8 с28,9 с43,9 %

Вчера из двух с половиной тысяч ответов ни один не пришёл быстрее 31 секунды — глухой пол, ниже которого не проваливался никто. Сегодня пола нет, и потолок в 21 запрос в минуту на всю платформу снят: прогоны шли на 216 вопросах в минуту.

Отсюда следствие: все замеры, снятые до этой правки, измеряли очередь за ключом, а не работу моделей. Выводы прошлых ночей о плато и о поведении карт недействительны.

7.3. Стенд пересобран

8. Все прогоны ночи

ПрогонЧатовОтветовВремя в1–15НаклеекПотерьСбоев
AIR 101030032,5 с310
AIR 252575029,5 с2920
AIR 50501 50037,4 с124320
AIR 1001003 00049,1 с4702680
AIR ночь (первый)1002 37045,6 с3201560
FLASH 101030017,3 с110
FLASH 50501 50031,2 с59160
FLASH 1001003 00045,6 с2411350
PLUS 101030031,0 с000
PLUS 151545030,4 с000
PLUS 202060033,0 с000
PLUS 222266035,3 с001
PLUS 252575068,9 с003
PLUS 50501 50076,7 с002
PRO 101030048,0 с000
PRO 252575076,6 с001
PRO 50501 500102,1 с000
Совместный: FLASH802 40041,2 с2431210
Совместный: PLUS401 200111,6 с005
Совместный: PRO20600140,3 с000

9. Выводы и предложения

Что делать с РАГ.

Он ограничивает всю платформу: 200 мест кончаются при 140 чатах на трёх ступенях, а карты ступеней при этом свободны. Кэш заполнен наполовину — упор в число мест, не в память. Стоит рассмотреть либо увеличение числа мест, либо вторую карту под РАГ. Расчётов по стоимости я не делал — это отдельный разговор.

Что делать с наклейкой.

Она отнимает у Эйра каждый шестой ответ, а срабатывает случайно. Это самый дорогой дефект по числу испорченных ответов за ночь: 1 638 наклеек у Эйра и 544 у Флеша.

Что делать с числом строк.

Ответ по таблице должен либо называть точное число, либо честно говорить «в найденных фрагментах столько-то». Сейчас частичное число подаётся как полное — читатель не может отличить.

Что делать с PLUS.

По качеству это лучшая ступень, но она держит вчетверо меньше нагрузки, чем Флеш, и единственная даёт сбои. Порог 22–25 чатов и таймаут 270,3 секунды — конкретные зацепки для разбора.

Чего я не проверил.