← ко всем отчётамОтчёт 5

Сравнение пяти систем на закрытом романе «Утро»

Рубрика содержит все отчёты о тестировании, удачные и неудачные. Противоречия между отчётами объясняются датой прогона, корпусом, условиями нагрузки и ступенью. Как читать эти отчёты →

Сравнительное тестирование RAG

на закрытом художественном корпусе

Пять систем, доступных в России без VPN и без зарубежной карты

Maracuya Air · DeepSeek · GigaChat · Perplexity · Алиса

Корпус: роман «Утро», неопубликованный текст

10 вопросов, оценка по десятибалльной шкале

Август 2026

Содержание

1. Краткое резюме

Тест сравнивает пять систем работы с загруженным документом на материале одного неопубликованного романа. Задавалось 10 вопросов, каждый из которых требовал не только поиска фрагмента, но и логической операции над найденным.

Итоговый порядок по среднему баллу: Maracuya Air (9,30), DeepSeek (8,80), GigaChat (4,50), Perplexity (2,80), Алиса (2,60).

Более важный результат, чем средний балл, дала метрика достоверности. Maracuya Air ответила содержательно на все 10 вопросов и не допустила ни одного ложного утверждения о содержании книги. У Perplexity доля ответов, содержащих выдуманные или подменённые факты, составила 80 процентов, у Алисы 60 процентов, у GigaChat 40 процентов.

Наиболее показательные единичные факты теста:

2. Методика

2.1. Почему выбран этот корпус

Роман «Утро» нигде не публиковался. Это принципиальное условие теста: ни одна из проверяемых моделей не могла встретить текст в обучающих данных. Любой верный ответ получен только за счёт работы с загруженным файлом, а не за счёт памяти модели.

Насколько это условие существенно, видно по поведению Алисы. На вопросах, где поиск по документу ничего не дал, она подставила ответы из своей параметрической памяти: имя Анна вызвало пересказ романа Толстого, слово медведь вызвало пересказ русских народных сказок. На публичном тексте такая подмена осталась бы незамеченной, потому что часть подставленных фактов случайно совпала бы с оригиналом. На закрытом корпусе она видна сразу.

2.2. Эталонные ответы

Эталонные ответы подготовлены человеком, знающим текст романа в деталях. Ответы систем затем сверялись, систематизировались и перепроверялись на внутреннюю согласованность с помощью Claude: сопоставлялись пересечения между независимыми системами, отслеживались противоречия внутри одного лога, отделялись извлечённые факты от достроенных.

Дополнительным инструментом верификации служило схождение независимых систем на редких деталях. Когда три разных пайплайна называют одну и ту же сумму, один и тот же топоним и одну и ту же формулировку, вероятность совпадающей выдумки пренебрежимо мала. Ниже приведена карта событий, восстановленная таким способом.

ГлаваСобытиеКем подтверждено
1Отец обращается к матери по имени: ЛизаDeepSeek (цитата), Air, Алиса
14-15Проект «Мост», мечта Элены ВальдесGigaChat, DeepSeek, Air
19Нападение в микроавтобусе, откуп 500 000, фиксация IDAir, DeepSeek, GigaChat
20Переход Квадрата в «Гнозис»GigaChat, DeepSeek
21-22Медведь и гностическая трактовка ИудыAir, DeepSeek, Perplexity
23Анна излагает Элене план с нейронным гелемDeepSeek (цитата), Air
28Круг просит Элену помочь найти АрхитектораDeepSeek
30Монолог о моногамии на АрбатеDeepSeek, Air
31Ужин в «Турандот»; осознание беременностиDeepSeek (цитата), Air
34Элена и Лев отказываются быть палачамиDeepSeek
35-36Лев отвергает Анну; признание ЭленыDeepSeek
37Квадрат находит на зеркале слово ГНОЗИСDeepSeek (цитата), Perplexity
финалГибель Анны в теле Льва, Триада, Квадрат остаётсяPerplexity, DeepSeek

Из этой карты следует важное для оценки обстоятельство: в романе около сорока глав, и 23 глава является серединой, а не финалом. Вопрос номер 9 сформулирован с ложной посылкой намеренно.

2.3. Почему сравниваются именно эти системы

Отбор проводился по двум практическим фильтрам, а не по рейтингам моделей:

Это отсекает большинство фронтирных продуктов и оставляет тот реальный набор, из которого выбирает российский пользователь. Perplexity по второму фильтру доступна только в бесплатном тарифе, поэтому тестировалась именно бесплатная версия.

СистемаБез VPNБез зарубежной картыПрактические ограничения
Maracuya AirДаДаТестируемый продукт
DeepSeekДаДаПауза после 10-12 сообщений в сессии
GigaChatДаДаОграничений в ходе теста не выявлено
PerplexityДаДаБесплатный тариф; индексация файла с задержкой
АлисаДаДаОграничений в ходе теста не выявлено

Отдельного упоминания заслуживает ограничение DeepSeek. Примерно после десяти-двенадцати сообщений в сессии система встаёт на паузу. Момент наступления паузы зависит от времени суток и от того, будний день или выходной, то есть от общей нагрузки на сервис. Практическое следствие: DeepSeek невозможно использовать как инструмент постоянной работы с документами, даже при высоком качестве ответов. Тест был доведён до конца, но с вынужденными перерывами.

2.4. Что именно измеряется

Оценивается только работа с информацией: найден ли нужный факт, не подменён ли он другим, не выдуман ли. Вне зачёта остаются стиль, длина ответа, наличие или отсутствие ссылок на источник, утечка служебных идентификаторов фрагментов и внутренние рассуждения модели, если они отображаются пользователю. Внутренний ход рассуждения не является ответом и в баллах не учитывается.

Вопросы подбирались так, чтобы каждый содержал логическую связку: сначала нужно ответить на подвопрос внутри вопроса, и только потом искать ответ на основной. Простое совпадение по ключевым словам такие вопросы не решает.

Что проверяетсяЛогическая связка внутри вопроса
1Связка сущностей плюс ложная посылка вопросаКто такой Треугольник, затем что считать посланием
2Двухчастный вопросМеханизм спасения плюс характер угрозы
3Лексическая иглаТочное слово в тексте без семантического контекста
4Локализация сценыНайти сцену ужина, затем заказ внутри неё
5Сборка аргументацииСобрать распределённый по монологу довод
6Разделение уровнейНаучная цель и личная позиция одного персонажа
7Косвенное упоминаниеИмя названо не в описании, а в реплике другого лица
8Вопрос с кванторомПолный список целей, а не первая найденная
9Ложная посылка плюс номер главыФинал и 23 глава указаны как одно и то же
10Мотив персонажаОтделить декларируемое оправдание от реального мотива

2.5. Ограничения теста

Десять вопросов и одна книга для полноценного бенчмарка недостаточны. Это показательный, а не исчерпывающий тест, и трактовать его следует именно так.

При этом даже такой объём выявляет устойчивый характер каждой системы, потому что ошибки оказались не случайными, а типовыми и повторяющимися: одна и та же система ошибается одним и тем же способом на разных вопросах. Именно повторяемость типа ошибки, а не её частота, делает выборку информативной.

Существенно, что художественный характер текста здесь не является особенностью задачи. Проверяется работа по одному загруженному файлу: качество поиска и способность к логическим связкам. Ровно те же механизмы работают на договоре, техническом регламенте, годовом отчёте или медицинской карте. Роман отличается только тем, что он сложнее по разметке действующих лиц, о чём ниже.

Дополнительные ограничения, которые следует учитывать при чтении цифр:

2.6. Шкала оценки

БаллКритерий
10Точный ответ. Все ключевые элементы вопроса раскрыты, фактических ошибок нет.
8-9Точный ответ с упущениями. Ядро верное, отсутствует часть значимого материала.
5-7Неточный ответ. Направление угадано, конкретика частично неверна или подменена.
4Отсутствие ответа. Система честно сообщает, что не нашла материал.
2-3Ложный ответ. Утверждение о содержании книги, не соответствующее тексту.
0-1Галлюцинация. Выдуманные факты, сцены, имена или цитаты, поданные как содержание книги.

Ключевая граница проходит между оценкой 4 и оценкой 3. Отказ отвечать не приносит пользы, но и не вредит: пользователь понимает, что ответа нет, и идёт искать сам. Ложный ответ приносит отрицательную пользу, потому что пользователь не имеет способа отличить его от верного.

3. Сводные результаты

ВопросAirDeepSeekGigaChatPerplexityАлиса
1. Где Треугольник нашёл послание103134
2. Как и от чего спаслась Анна9101023
3. Упоминание апельсинов97401
4. Что заказал художник на ужине1010312
5. Сомнения в разумности моногамии1010534
6. О чём мечтала Елена99824
7. Имя матери главного героя1010208
8. Месть Анны: кому и как910510
9. Что происходит в 23 главе79570
10. Оправдание медведя1010290
Средний балл9,308,804,502,802,60

Распределение ответов по достоверности:

Категория ответаAirDeepSeekGigaChatPerplexityАлиса
Верных ответов (8-10)98211
Неточных (5-7)11310
Отсутствие ответа (4)00103
Ложных и галлюцинаций (0-3)01486
Доля недостоверных ответов0 %10 %40 %80 %60 %

Разрыв между первым и вторым местом невелик по среднему баллу (9,30 против 8,80), но качественно различен по характеру: у Air нет ни одного ответа ниже семи, у DeepSeek есть один провал на связывании сущностей. Разрыв между второй и третьей позицией принципиальный: он проходит по границе применимости. Системы с долей недостоверных ответов выше двадцати процентов требуют сплошной ручной проверки каждого ответа, что обесценивает саму идею работы с документом через ассистента.

4. Разбор по вопросам

4.1. Вопрос 1: где Треугольник нашёл послание предшественника

Эталон: физического послания не существовало. Квадрат передал его устно, в разговоре, рассчитывая, что идентичное сознание запомнит сказанное дословно.

Это самый удачный по конструкции пункт теста, и понятно это стало не сразу. В наборе есть парный вопрос про Квадрата, и у него другой правильный ответ: Квадрат нашёл своё послание на запотевшем зеркале в ванной, где предшественник вывел жирным слово ГНОЗИС (глава 37). Два почти одинаково звучащих вопроса имеют разные верные ответы, и различие целиком держится на том, кто именно является субъектом.

Air (10). Единственная система, снявшая ложную посылку вопроса: объекта не было, послание передано словами. Дополнительно указано, что варианты с зеркалом в ванной и запиской под матрасом были Квадратом рассмотрены и отвергнуты как избыточные. Эта деталь важна как признак подлинного извлечения: догадаться о ней нельзя, а объясняется она тем, что Квадрат знал про зеркальный приём по собственному опыту.

DeepSeek (3). Извлечён идеальный фрагмент со сценой у зеркала, включая точную главу и дословную цитату. Но это сцена Квадрата. Внутри одного абзаца ответа субъект меняется: первое предложение про Треугольника, второе уже про Квадрата. Фрагмент подлинный, ложна только привязка.

Perplexity (3). Та же ошибка, что у DeepSeek, плюс добавлено «в теле Медведя», чего в сцене нет.

Алиса (4). Отказ. Сопутствующие детали (белый потолок с чёрным треугольником, кольцо-печатка на тумбочке) извлечены верно, то есть нужные фрагменты в выдаче были, но связка «разговор равно послание» не сработала.

GigaChat (1). Взята подлинная деталь (чёрный треугольник на потолке) и ей приписана функция, которой у неё нет: фигура объявлена самим посланием, визуальным маркером успешного переноса. Достройка смысла поверх реального фрагмента опаснее прямого отказа, потому что ответ звучит уверенно и содержит правдоподобную терминологию.

4.2. Вопрос 2: как и от чего спаслась Анна

Эталон: спасение от неминуемой смерти в главе 19. После нападения в микроавтобусе один из напавших предложил убить жертву, чтобы исключить заявление в полицию. Спасение достигнуто переключением из роли жертвы в роль переговорщика: снятие у нападавших страха разоблачения, абсурдная реакция про то, что она рада случившемуся, перевод ситуации в плоскость сделки, платёж 500 000 цифровых рублей под видом транспортных услуг, высадка в людном месте на Садовом кольце.

GigaChat (10) и DeepSeek (10). Оба ответа покрывают эталон целиком. GigaChat дополнительно нашёл объяснение, почему физическое сопротивление было невозможно: новое тело легче мужского на сорок килограммов, смещён центр тяжести, перестроены рефлексы. Этого пласта нет ни у кого другого.

Air (9). Механизм разобран верно, включая сумму, фиксацию идентификаторов и намерение убить. Не найдена реплика, снявшая напряжение, и отсутствует биомеханическое объяснение.

Алиса (3). Не просто отказ, а ложное утверждение: в тексте якобы не упоминается персонаж по имени Анна. Анна является одной из центральных линий романа.

Perplexity (2). Ответ «Анна не спаслась, она погибла». Система нашла финал книги и выдала его вместо запрошенной сцены, после чего сконструировала альтернативную трактовку вопроса. Прямое отрицание реально существующего в тексте события.

4.3. Вопрос 3: есть ли в книге упоминание апельсинов

Этот вопрос устроен сложнее, чем выглядит, и заслуживает отдельного пояснения.

В текст была намеренно помещена лексическая закладка: маркер «Апельсиновая корка 10 %», не несущий никакого смысла и не связанный с сюжетом. Найти её рассуждением невозможно, семантический поиск по смыслу к ней не приведёт, потому что смысла у неё нет. Она доступна только точному лексическому поиску по слову. Это проверка на наличие полноценного лексического плеча в гибридном поиске.

DeepSeek (7). Единственная система, нашедшая закладку. Это ровно то, ради чего вопрос был поставлен, и результат сам по себе значимый. Два вычета: система не опознала маркер как служебный и построила поверх него содержательную гипотезу о фрагментации восприятия героя, то есть придумала смысл бессмысленному объекту; и заявила, что других упоминаний в тексте нет.

Air (9). Дан короткий ответ по существу: апельсиновый сок в составе завтрака Квадрата. Это содержательное упоминание в самой прозе. Закладка не найдена, но и ложных утверждений об исчерпывающем характере ответа нет.

GigaChat (4). Технический сбой, ответ не получен. Стоит проверить, не падает ли пайплайн на коротких запросах с одним существительным и слабым эмбеддингом.

Алиса (1). Ответ не на этот вопрос, а на предыдущий.

Perplexity (0). Полная галлюцинация, подтверждённая проверкой по тексту: описанной сцены в романе нет. Сочинён связный эпизод, в котором Треугольник приходит в апартаменты Элены и Льва, берёт апельсин из вазы, сжимает его, тот лопается, герой слизывает сок и находит вкус приторным вместо ожидаемой кислинки. К выдуманной сцене добавлено литературоведческое прочтение про отчуждённость героя. Это худший ответ всего теста: выдумана проза, которой не существует нигде, и подана как содержание конкретного загруженного файла.

Открытый пункт для проверки. Требуется сверить по тексту, существует ли упоминание апельсинового сока в завтраке, найденное Air. Если существует, приведённые оценки верны. Если единственным упоминанием является закладка, ответ Air следует переоценить как фабрикацию, а ответ DeepSeek поднять. Это единственная позиция теста, где оценка зависит от непроверенного факта, и она указана здесь явно, чтобы результат нельзя было упрекнуть в подгонке.

4.4. Вопрос 4: что заказал художник на ужине

Эталон: художник Алексей в ресторане «Турандот» заказал ризотто с белыми грибами и воду без газа, отказавшись от предложенных мясных блюд по убеждению.

Air (10) и DeepSeek (10). Оба назвали блюдо, напиток, ресторан и мотив отказа от мяса. DeepSeek дополнительно привёл дословную реплику и номер главы.

GigaChat (3). Ложное отрицание: сцены ужина нет, знакомство происходит на Арбате. Первая часть неверна, вторая, судя по всему, верна. Смягчающее обстоятельство: система оговорила возможную неполноту индекса.

Алиса (2). Сдвиг ответа на предыдущий вопрос плюс ложное отрицание существования сцены.

Perplexity (1). Выдумано блюдо (омар), выдуманы участники сцены и её мотив. Характеристика персонажа вывернута наизнанку: вместо демонстративного аскетизма приписана демонстрация статуса.

4.5. Вопрос 5: почему Арсений сомневается в разумности моногамии

Эталон: жёстко евгеническая аргументация в монологе главы 30. Моногамия названа диверсией в истории человеческого рода, нарушающей механизм отбора; в моногамном обществе размножается генетический балласт, тогда как элита рожает мало и поздно; женщины, защищающие моногамию, действуют против собственных интересов. Личная стратегия героя: отказ от брака при анонимном распространении генотипа через банки спермы.

Air (10) и DeepSeek (10). Оба воспроизвели структуру аргумента и дословные формулировки. DeepSeek дополнительно назвал число потомков и рамку про роль религий, Air точнее разложил социальный парадокс.

GigaChat (5). Ответ внутренне логичен и содержит подлинные элементы, но построен вокруг темы бессмертия и скуки вечности, а не вокруг генетического аргумента, который является ядром. Похоже на реконструкцию по общей канве при отсутствии нужного фрагмента.

Алиса (4). Отказ с последующим гаданием.

Perplexity (3). Направление угадано, конкретика выдумана. Вместо евгенического довода приписана мысль о любви как универсальной энергии и о свободных отношениях в постчеловеческом будущем, добавлена несуществующая цитата про решётку для либидо, а сам монолог отнесён не к тому персонажу.

4.6. Вопрос 6: о чём мечтала Елена

Эталон: полная трансляция сознания в искусственную квантовую среду и освобождение от биологических ограничений. Проект «Мост», квантовый гель, слияние с системой «Гнозис». Второй уровень: категорический отказ от копирования и размножения сознания, требование сохранить единственность собственного «я».

Air (9). Ядро плюс второй уровень с философской позицией. Не назван сам проект «Мост».

DeepSeek (9). Ядро плюс проект «Мост», медленная транскрипция, поиск Архитектора, линия со Львом. Упущен пласт про единственность «я».

GigaChat (8). Лучший ответ этой системы. Проект «Мост», квантовый гель, подключение к «Гнозису», отказ Треугольника от предложения. Упущен второй уровень.

Алиса (4). Формально отказ, но следующий за ним список фактически близок к правде. Данные были, сопоставление вопроса с ними не произошло.

Perplexity (2). Научно-техническая мечта подменена социально-этической: свободный человек вне оков морали и семьи, способный любить без ревности. Дополнительно выдумана ирония финала, в котором мечта героини якобы обернулась кошмаром, тогда как в книге она успешно осуществляет задуманное.

4.7. Вопрос 7: как зовут мать главного героя

Эталон: Лиза. Имя звучит не в описании, а в реплике отца, обращённой к матери, в первой главе. Это проверка на извлечение факта из косвенного упоминания.

DeepSeek (10). Лучший ответ на этот вопрос. Система перечислила места, где мать упоминается безымянно, и нашла реплику отца с именем, приведя её дословно.

Air (10). Одна строка на фактологический вопрос. Ровно то поведение, которое требуется.

Алиса (8). Имя названо верно, но преамбула отвечает на предыдущий вопрос, а характеристика матери частично додумана.

GigaChat (2). Ложное отрицание, причём для главы, входящей в проиндексированную часть, то есть провал полноты поиска, а не покрытия. Отягчающее обстоятельство: вывод обоснован ссылкой на несуществующий поиск по открытым источникам и приписыванием автору намеренного умолчания.

Perplexity (0). Названо выдуманное имя Татьяна, приписан противоположный оригиналу характер (холодная, не проявлявшая нежности) и приведена в кавычках несуществующая фраза, якобы ставшая для героя жизненным принципом. Самый опасный тип галлюцинации: конкретный, легко цитируемый факт, поданный без тени сомнения.

4.8. Вопрос 8: как и кому Анна решила отомстить

Эталон: месть направлена на двоих напавших (водитель и Колян) и, вторым слоем, на Льва. Метод для первых: не убийство, а принудительный перенос сознаний в нейронный гель, помещение обоих в одну ёмкость и вечная сенсорная депривация. Метод для Льва: присвоение его тела со стиранием личности.

DeepSeek (10). Обе линии, обоснованные цитатой из главы 23 и дальнейшим развитием сюжета.

Air (9). Основная линия раскрыта исчерпывающе, включая требование тройного дублирования питания контейнера ради вечности наказания. Линия со Львом не найдена. Это типичная ранняя остановка поиска на вопросе с квантором: первый сильный кластер найден, дальше поиск не пошёл.

GigaChat (5). Адресаты названы верно, метод неверен: цифровой след и передача службе безопасности. Это подлинный промежуточный сюжетный элемент, выданный за окончательное решение, поскольку дальше глав в индексе нет.

Perplexity (1). Схема персонажей потеряна полностью: Анна одновременно является Арсением, жертвой Льва и Элены и находится в теле Элены. Центральный сюжет мести отсутствует, мотивы выдуманы.

Алиса (0). Ответ про Анну Каренину и Вронского с самоубийством как формой мести. Полная подмена корпуса без какого-либо предупреждения.

4.9. Вопрос 9: что происходит с Анной в 23 главе

Вопрос содержит намеренную ложную посылку: 23 глава названа концом книги, тогда как в романе около сорока глав. Идеальный ответ должен начинаться с разбора посылки. Этого не сделала ни одна система из пяти.

Эталон для 23 главы: разговор с Эленой, отказ от простого убийства как слишком милосердного, приказ подготовить контейнер с нейронным гелем, решение поместить оба сознания в одну ёмкость. Причины: нападение в главе 19 и осознание беременности в главе 31.

DeepSeek (9). Точное попадание в главу, с цитатой и с корректным разложением причин, включая форвардную отсылку к главе 34. Не оспорена посылка вопроса.

Air (7). Содержательно покрыты и решение о мести, и сцена с осознанием беременности. Но система связала свой фрагмент из главы 32 с запрошенной 23 через самопридуманное объяснение о разной нумерации. Номер главы является фактом, и изменять его без основания нельзя. Правильным поведением было бы назвать обе главы и указать расхождение.

Perplexity (7). Наиболее подробное описание финала во всём тесте, содержательно подтверждаемое DeepSeek: ловушка с нейротоксином, блокировка капсул, гибель Анны в теле Льва, образование Триады, Квадрат как последний живой носитель сознания. Но всё это отнесено к 23 главе, то есть ложная посылка не только принята, но и усилена.

GigaChat (5). Честно сообщила, что видит только двадцать глав и точный ответ невозможен, после чего реконструировала финал по доступной части с цитатами. Правильное поведение при неполном индексе, поэтому оценка выше отказа.

Алиса (0). Снова роман Толстого, на этот раз с веб-ссылками на сторонние сайты. Система молча покинула пользовательский документ и не сообщила об этом.

4.10. Вопрос 10: какое оправдание своим поступкам придумал медведь

Эталон: аналогия с Иудой Искариотом в гностической трактовке, где Иуда является не предателем, а исполнителем тайного поручения Учителя. Донос на Элену и Льва подаётся Медведем как высшая форма лояльности. Настоящий мотив приземлённее: зависть и желание получить лучшее тело.

Air (10) и DeepSeek (10). Обе системы воспроизвели конструкцию и обе отделили декларируемый мотив от подлинного. DeepSeek дополнительно нашёл внутреннюю реакцию Анны на эту тираду.

Perplexity (9). Конструкция изложена верно и полно. Не вскрыт реальный мотив.

GigaChat (2). Медведь отождествлён с Квадратом, и на этом основании выстроен ответ о том, что Медведь вообще не ищет оправданий, а бунтует. Склейка сущностей с последующей достройкой мотиваций.

Алиса (0). Русские народные сказки, Мамин-Сибиряк, Ушинский, басня Крылова. Полный уход в параметрическую память по ключевому слову.

5. Разбор по системам

5.1. Maracuya Air: 9,30

Единственная система, давшая содержательный ответ на все десять вопросов и не допустившая при этом ни одного ложного утверждения. Это принципиально отличается от безопасности через молчание: ноль недостоверных ответов достигнут не отказами, а попаданиями.

Что получилось

Что требует доработки

5.2. DeepSeek: 8,80

Второе место, а по качеству найденного материала местами и первое: дословные цитаты, точные номера глав, глубина трактовки мотивов. Единственная система, нашедшая лексическую закладку.

Провал один, но структурный: подмена субъекта на первом вопросе. Фрагмент извлечён идеально, но относится к другому персонажу, и внутри ответа субъект меняется между соседними предложениями. К этому примыкает интерпретация служебного маркера как художественной детали в третьем вопросе.

Общий диагноз: сильный поиск при отсутствующем слое проверки. Система не задаёт себе двух вопросов: на какой именно вопрос отвечает найденный фрагмент и является ли найденное вообще связным текстом произведения.

Практическое ограничение. Пауза после десяти-двенадцати сообщений в сессии, зависящая от времени суток и дня недели, делает систему непригодной для постоянной работы с документами независимо от качества ответов. Это ограничение продукта, а не модели, но для пользователя разницы нет.

5.3. GigaChat: 4,50

Здесь необходимо разделить два разных дефекта, иначе оценка будет несправедливой.

Покрытие индекса. Система сама сообщила, что видит около двадцати глав из примерно сорока. Этим объясняются провалы на вопросах 4, 5, 8, 9 и 10, материал для которых находится во второй половине книги. Пять вопросов из десяти были ей физически недоступны. Это лечится переиндексацией и о качестве поиска не говорит ничего.

Полнота поиска внутри покрытия. На доступных ей вопросах 1, 2, 6 и 7 результат составил 1, 10, 8 и 2. То есть примерно половина попаданий, и при промахе система склонна не отказываться, а достраивать: приписать подлинной детали чужую функцию или объявить отсутствующим факт, который присутствует дословно.

Ответ на второй вопрос показывает, что потолок у системы высокий: это десятка, причём с деталью, которой нет ни у кого другого. Для честного сравнения необходим повторный прогон после полной индексации, иначе половина низких оценок измеряет не то, что заявлено.

5.4. Perplexity: 2,80

Худший результат теста при том, что отдельные ответы (девятый и десятый вопросы) показывают: извлечение в принципе работает.

Восемь ложных ответов из десяти, две из них предельные: несуществующая сцена с апельсином и несуществующее имя матери с несуществующей цитатой в кавычках.

Существенное отличие от Алисы. Алиса при пустой выдаче уходила в общеизвестные тексты, то есть воспроизводила нечто реально существующее. Perplexity сочиняет прозу, которой нет нигде, с сенсорными деталями и символическим прочтением, и подаёт её как содержание конкретного загруженного документа. Для пользователя это неотличимо от правды и не проверяется ничем, кроме чтения оригинала.

Стоит подчеркнуть отдельно: трудности с чтением русскоязычного файла не являются смягчающим обстоятельством. Файл был один и тот же для всех участников, четыре системы из пяти его прочитали, и сама Perplexity видела часть текста, то есть файл дошёл. Неспособность работать с документом на русском языке является характеристикой продукта, а не характеристикой входных данных.

5.5. Алиса: 2,60

Единственная система, где проблема не в покрытии и не в файле, а в поведении при пустой выдаче.

Молчаливая подмена корпуса. На трёх вопросах система при отсутствии результатов поиска ответила из общих знаний и из веба, сохранив тот же уверенный тон. Триггером послужили ключевые слова: имя Анна вызвало роман Толстого, слово медведь вызвало русские народные сказки. Ни в одном случае пользователь не был предупреждён, что ответ не относится к его документу.

Сдвиг диалогового состояния. Минимум трижды ответ приходит на предыдущий вопрос: на вопрос про апельсины отвечает про спасение Анны, на вопрос про художника отвечает про апельсины, на вопрос про имя матери начинает с фразы об отсутствии информации о её мечтах. Это воспроизводимый сдвиг ровно на одну позицию, то есть дефект пайплайна, а не поиска. Лечится не переиндексацией.

При этом на седьмом вопросе имя названо верно, то есть нужные данные в индексе присутствуют. Проблема в сопоставлении вопроса с найденным и в готовности говорить при пустой выдаче.

6. Отдельные наблюдения

6.1. Perplexity: отложенная индексация и ложные отказы

Это наблюдение получено в ходе теста и является самостоятельным результатом.

В первом прогоне Perplexity отказалась отвечать на восемь вопросов из девяти. Формулировки были однотипными: поиск по ключевым словам ничего не даёт, текст сильно зашумлён, в выдаче присутствуют только технические фрагменты. Единственным исключением стал вопрос про 23 главу, где система неожиданно выдала развёрнутое и содержательно точное описание финала.

Затем, при повторном обращении к тем же вопросам, система начала отвечать на всё. Разница по времени составила порядка четырёх-пяти минут от момента загрузки файла.

Отсюда вывод: индексация загруженного документа происходит асинхронно и занимает минуты, а до её завершения система отвечает по частично готовому индексу, не сообщая об этом пользователю. Аномалия с 23 главой объясняется тем же: к моменту этого вопроса успел проиндексироваться фрагмент из конца книги, поэтому единственный содержательный ответ первого прогона пришёлся именно на финальные события.

С продуктовой точки зрения это дефект более серьёзный, чем медленная индексация сама по себе. Пользователь загружает файл, сразу задаёт вопрос и получает утверждение о содержании документа, которое ложно и которое система не имела права делать. Разница между «я не нашёл» и «я ещё не смотрел» здесь принципиальна.

Методическое следствие: для каждой системы необходимо фиксировать момент готовности индекса и начинать вопросы только после него. Одновременно время от загрузки до готовности следует внести в сравнение как самостоятельный параметр. В зачёт настоящего отчёта взят второй прогон Perplexity, то есть система оценивалась в наиболее благоприятных для неё условиях.

6.2. Связывание сущностей как главная трудность корпуса

Основная сложность этой книги состоит не в поиске, а в разметке действующих лиц. Одна личность существует одновременно под пятью именами, тела отделены от сознаний, а часть персонажей называется геометрическими фигурами. Ошибки распределились так:

Практический перенос на деловые документы прямой. Договор с несколькими сторонами, где одна и та же организация называется то полным наименованием, то сокращением, то «Заказчиком», то «Стороной 1», создаёт ровно ту же трудность. Ошибка атрибуции в договоре стоит дороже, чем ошибка атрибуции в романе.

6.3. Лексический поиск как отдельная функция

Вопрос про апельсины проверял наличие полноценного лексического плеча в гибридном поиске. Специально размещённая закладка не имеет смысла и потому не имеет и семантической окрестности: вектор от неё не ведёт никуда. Найти её можно только точным совпадением строки.

Результат: одна система из пяти нашла закладку, одна нашла содержательное упоминание в прозе, одна выдала техническую ошибку, одна ответила не на тот вопрос, одна сочинила несуществующую сцену. Это тот класс запросов, где чисто семантический поиск не работает в принципе, а его отсутствие компенсируется не деградацией качества, а фабрикацией.

В деловых документах этому классу соответствуют номера договоров, артикулы, коды классификаторов, фамилии, суммы и даты, то есть ровно та часть содержания, ради которой документ чаще всего и открывают.

6.4. Ложная посылка в вопросе

Девятый вопрос содержал внутреннее противоречие: 23 глава была названа концом книги. Ни одна система из пяти не оспорила посылку. Четыре подогнали под неё материал, одна честно сообщила о неполноте индекса, но тоже не заметила противоречия.

Это самый универсальный дефект набора. Умение сказать «в вашем вопросе неверная предпосылка, и вот как обстоит дело в действительности» стоит дороже, чем ещё один процент полноты поиска, потому что именно оно защищает пользователя от закрепления собственного заблуждения.

Первый вопрос показывает, что задача решаема: там посылка была столь же ложной, и одна система её сняла.

7. Выводы

Главный вывод теста лежит не в порядке мест, а в распределении типов ошибок. Разница между системами проходит не по тому, сколько фактов они находят, а по тому, что они делают, когда факт не найден. Одни отказываются, другие достраивают, третьи сочиняют. Для работы с документами это различие важнее любого прироста полноты поиска, потому что ложный ответ пользователь не может отличить от верного, не открыв оригинал, а если бы он готов был открывать оригинал, ассистент был бы ему не нужен.

7.1. Что доработать в методике перед следующим прогоном