Генеративный ИИ
Как языковая модель создаёт ответ
Токены, контекст и причины, по которым связный ответ требует проверки.
Текст превращается в токены
Большая языковая модель, или LLM, обрабатывает текст как последовательность токенов. Токен может соответствовать слову, части слова или знаку. Поэтому число токенов не равно числу слов.
При генерации типичная авторегрессионная модель оценивает возможные следующие токены с учётом доступного контекста. Выбранный токен добавляется к последовательности, и процесс повторяется.
Что находится в контексте
Контекст — информация, которую модель получает для текущего ответа: инструкции, запрос, переданные документы и доступная часть истории. Его объём ограничен возможностями модели и приложения.
Например, задача «сократи этот текст» становится определённой, когда в запросе есть сам текст, аудитория и желаемая длина. Модель может использовать сведения из обучения, но не получает автоматически доступ ко всем вашим файлам или интернету.
Почему ответ может быть ошибочным
Связность текста не подтверждает его фактическую точность. Модель способна создать правдоподобное утверждение, которого нет в источнике; такие ошибки часто называют галлюцинациями.
- Сверяйте имена, даты и числа с исходным документом.
- Открывайте приведённые ссылки: название источника само по себе ничего не доказывает.
- Проверяйте, не потерялись ли исключения и условия при сокращении текста.
- Просите явно отмечать сведения, которых в переданных материалах нет.
