Аугментация данных для задачи Text-to-SQL
архитектура, метод и результаты
Аннотация
Задача Text-to-SQL направлена на автоматическое построение корректного SQL-запроса по вопросу на естественном языке. Основные вызовы включают генерацию сложных многотабличных запросов с объединениями, агрегатами и вложенными подзапросами, а также переносимость на ранее невидимые схемы баз данных. Такие запросы типично требуют знания бизнес-логики и структуры конкретной СУБД, что недоступно конечному пользователю без подготовки. При этом необходимо не только синтаксически корректное порождение SQL, но и семантическая точность: запрос должен возвращать именно тот набор данных, который подразумевает исходная формулировка. Работа описывает воспроизводимый конвейер аугментации обучающих данных для компактной модели класса T5-base. Конвейер включает синтез новых пар вопрос– запрос с помощью обратной генерации (SQL→NL), контролируемое перефразирование пользовательских формулировок и автоматическую фильтрацию низкокачественных вариантов. Важной частью конвейера является автоматическая верификация корректности сгенерированного SQL путём выполнения запроса на тестовой базе данных и анализа возвращаемых результатов. Это позволяет оценивать не только формальную близость к эталону, но и фактическую пригодность для аналитического использования. Целью исследования является проверка гипотезы о том, что целенаправленная аугментация данных позволяет существенно повысить качество компактной модели (порядка сотен миллионов параметров) без перехода к значительно более крупным языковым моделям с числом параметров в десятки миллиардов. Улучшение измеряется по метрикам Exact Match (структурное совпадение с эталонным SQL) и Execution Accuracy (совпадение результата выполнения запроса). Показано, что такой конвейер повышает устойчивость генерации сложных запросов и делает модель более пригодной к практической интеграции в аналитические процессы.

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Редакционная политика журнала основывается на традиционных этических принципах российской научной периодики и строится с учетом этических норм работы редакторов и издателей, закрепленных в Кодексе поведения и руководящих принципах наилучшей практики для редактора журнала (Code of Conduct and Best Practice Guidelines for Journal Editors) и Кодексе поведения для издателя журнала (Code of Conduct for Journal Publishers), разработанных Комитетом по публикационной этике - Committee on Publication Ethics (COPE). В процессе издательской деятельности редколлегия журнала руководствуется международными правилами охраны авторского права, нормами действующего законодательства РФ, международными издательскими стандартами и обязательной ссылке на первоисточник.
Журнал позволяет авторам сохранять авторское право без ограничений. Журнал позволяет авторам сохранить права на публикацию без ограничений.
Издательская политика в области авторского права и архивирования определяются «зеленым цветом» в базе данных SHERPA/RoMEO.
Все статьи распространяются на условиях лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная, которая позволяет другим использовать, распространять, дополнять эту работу с обязательной ссылкой на оригинальную работу и публикацию в этом журналe.
