В текущих исследованиях всё больше внимания уделяется не только генерации, но и тому, как измерять качество: factuality, answerability, groundedness, faithfulness, instruction quality.
В работе используются LLM-as-a-Judge подходы, автоматизированные фильтры, человеческая валидация и метрики согласованности.