Опубликовано в proceedings SIGDIAL 2023, Prague, Czechia, pp. 242–254.
В работе исследуется сложная разметка open-domain диалогов по многоуровневой системе речевых функций. Вместо прямой классификации на большое число классов используется иерархическая последовательность простых вопросов, понятная как человеку без специальной лингвистической подготовки, так и LLM.
Сравниваются результаты экспертов, краудсорсеров и ChatGPT. Дополнительно исследуются prompt-engineering подходы. Работа показывает, что многошаговая tree-like схема способна заметно повысить качество автоматической разметки и в отдельных режимах приблизить LLM к человеческой согласованности.