Промпт-инжиниринг для анализа документов
Три промпта из общего гайда по работе с источниками закрывают только базовый случай. Здесь — расширенная библиотека рабочих запросов для извлечения, сравнения, проверки и разбора документов разных типов: от научных статей до интервью и договоров.
Зачем отдельная библиотека, а не один универсальный промпт
В общем разборе работы с источниками уже есть три рабочих промпта для извлечения, сравнения и проверки гипотезы. Их достаточно для большинства задач, но у каждого типа документа и каждого этапа анализа свои требования к формулировке, и один промпт "на всё" почти всегда даёт средний результат везде вместо точного результата в конкретном случае.
Ниже промпты сгруппированы по задаче, а не по типу документа: сначала извлечение, потом сравнение и синтез, потом проверка, потом отдельно то, что стоит менять в зависимости от жанра источника.
Извлечение: получить структуру, а не пересказ
Обычная просьба "перескажи документ" почти всегда даёт ровный, обтекаемый текст без структуры, по которому невозможно сравнивать разные источники между собой. Явная структура в самом промпте решает эту проблему:
Разбери документ по структуре: цель работы, метод, ключевой результат,
ограничения, которые признаёт сам автор. Для каждого пункта одна-две
фразы, не абзац. Если какого-то пункта в тексте нет явно, так и напиши:
"не указано", а не пытайся его реконструировать по контексту.
Второй, для документов с конкретными числовыми утверждениями:
Найди в документе все места с конкретными цифрами: проценты, суммы,
даты, размеры выборки. Для каждой цифры укажи точную цитату и номер
страницы или абзаца, откуда она взята. Ничего не округляй и не
пересчитывай самостоятельно.
Второй промпт напрямую страхует от проблемы, о которой в pillar 3 рассказан конкретный случай: модель округляет и обобщает цифры, если явно не потребовать точную цитату рядом с каждой из них.
Сравнение и синтез: искать разногласие, а не согласие
Модель по умолчанию склонна сглаживать противоречия между источниками до нейтрального "мнения расходятся". Явный запрос на разногласие меняет это:
Вот тезисы из нескольких источников по одному вопросу: [список тезисов].
Раздели их на три группы: источники, которые прямо согласны друг с
другом; источники, которые прямо противоречат друг другу; источники,
которые говорят о разных аспектах вопроса и формально не пересекаются.
Для группы прямых противоречий явно назови, в чём именно расхождение.
Для случая, когда нужно оценить силу доказательной базы, а не просто список мнений:
Оцени, насколько уверенно можно утверждать [конкретный тезис] на
основе приведённых источников: сильная доказательная база, слабая,
или источников просто недостаточно для вывода в любую сторону.
Обоснуй оценку конкретными признаками (размер выборки, повторяемость
результата в разных работах, наличие прямых опровержений).
Проверка: ловить придуманное до того, как оно попадёт в текст
Проверочные промпты работают лучше всего, если просить модель саму оценивать уверенность, а не только выдавать ответ:
Ответь на вопрос [вопрос], используя только содержимое документа.
Если ответ явно есть в тексте, укажи точную цитату. Если ответа нет
или он подразумевается, но не сказан прямо, явно напиши: "документ
не даёт прямого ответа" вместо того, чтобы достраивать вывод сам.
Вот утверждение, которое я собираюсь использовать в тексте: [утверждение].
Вот исходный документ: [текст].
Проверь: утверждение точно соответствует тексту, является упрощением
исходной мысли, или искажает её. Если это упрощение или искажение,
покажи разницу между тем, что написано у автора, и тем, что я
собираюсь написать.
Второй промпт полезен именно на этапе, когда черновик текста уже написан и нужно свериться с источником перед тем, как отдать работу дальше, будь то диплом, отчёт клиенту или статья.
Что менять под конкретный тип документа
Три базовых промпта из pillar 3 и библиотека выше рассчитаны на текстовый источник общего вида. Конкретные жанры требуют своих поправок:
- Научная статья. Добавляй в промпт прямое требование различать результат самого исследования и интерпретацию автора: одно дело, что показал эксперимент, другое, что автор об этом думает. Модели легко смешивают эти два слоя, если не попросить их разделить явно.
- Интервью и расшифровка разговора. Проси сохранять авторство реплик и не объединять сказанное разными участниками в общую формулировку: "оба собеседника согласились с X" почти всегда упрощение, если на самом деле один сказал X, а второй просто не возразил.
- Договор или юридический документ. Проси указывать номер пункта или статьи при каждом утверждении и отдельно отмечать формулировки, которые допускают двойное толкование, а не только те, что кажутся однозначными.
- Внутренний отчёт компании. Проси явно отделять факты от рекомендаций и прогнозов внутри одного документа: в бизнес-отчётах эти два слоя обычно перемешаны сильнее, чем в академическом тексте.
Как эта библиотека вписывается в общий процесс
Промпты сами по себе не заменяют шаги систематизации и синтеза из общего разбора: они ускоряют конкретные точки внутри уже выстроенного процесса. Если сам процесс работы с источниками, от захвата до финального текста, ещё не выстроен, начинать стоит с него, а библиотеку промптов держать под рукой как справочник, к которому возвращаешься на конкретном шаге, а не как замену самому процессу.
Куда дальше
AI для исследователей: как выстроить workflow работы с источниками разбирает весь процесс целиком: систематизацию источников, синтез, проверку на галлюцинации и то, куда девать результат после того, как работа сдана.
Комментарии
Комментариев пока нет. Будь первым.