Это не сбой модели, а то, как она устроена. Языковая модель обучена продолжать текст правдоподобно — и если её не заставить сослаться на конкретное место в конкретном документе, она заполнит пробел похожим на правду текстом. Внешне он ничем не отличается от настоящего вывода. Разница обнаруживается только тогда, когда его пытаются проверить.

Правило ссылки формулируется просто: у каждого утверждения в ответе агента должна быть ссылка, и ссылка — это не одна вещь, а три. Имя файла — ровно так, как он называется в папке дела, без сокращений и пересказа. Место внутри документа — лист, пункт, раздел. Дословная цитата в пять–десять слов, если у документа нет собственной нумерации и сослаться на пункт нельзя. Утверждение, у которого есть не все три части, — черновик, а не ответ, и вносить его в работу как готовый вывод нельзя.

Проверяется это тестом на разницу. «Груз был закреплён с нарушениями» — утверждение, которое нельзя проверить: неясно, откуда оно взялось, стоит ли за ним реальный документ или обученная на похожих делах догадка. Ответ — то же утверждение с указанием документа, пункта и цитаты: «Груз был закреплён с нарушениями (акт осмотра груза.pdf, п. 4: «крепление выполнено с отступлением от схемы размещения»)». Первую формулировку нельзя проверить в принципе. Вторую — за тридцать секунд: открыть файл, найти пункт, сравнить цитату.

Разница между ними не в качестве анализа — фраза без ссылки может оказаться верной по существу. Разница в том, что её нельзя перепроверить, не поднимая всё дело заново. А проверка утверждения, у которого уже есть документ, пункт и цитата, — это не отдельная задача, а действие, встроенное в саму ссылку: она либо подтверждается за полминуты, либо явно не подтверждается, и тогда становится сразу понятно, что перед этим агент выдал не результат, а предположение, оформленное как результат.