Google Research представил TabFM — новую модель для работы с табличными данными. Она упрощает задачи классификации и регрессии, которые используются для прогнозирования оттока клиентов или выявления финансового мошенничества.
Традиционные модели, такие как XGBoost или случайные леса, требуют значительных усилий для настройки. Специалисты тратят время на оптимизацию гиперпараметров и инженерию признаков. TabFM работает по принципу «нулевого выстрела» (zero-shot prediction), как большие языковые модели.
Модель обрабатывает весь набор данных, включая обучающие примеры и тестовые строки, как единый контекст. Это позволяет ей изучать взаимосвязи между столбцами и строками во время выполнения запроса, без изменения весов модели. Такой подход исключает необходимость ручного обучения и сложной подготовки данных.
Архитектура TabFM сочетает механизмы для обработки двумерной природы таблиц. Модель использует чередующееся внимание между строками и столбцами для извлечения зависимостей между признаками. Затем информация каждой строки сжимается в векторное представление.
Для предсказаний используется механизм «обучения в контексте» (in-context learning) с помощью отдельного трансформера. Это снижает вычислительные затраты, делая процесс предсказания эффективным даже для больших наборов данных.
TabFM обучалась на сотнях миллионов синтетических наборов данных. Это было необходимо из-за ограниченной доступности больших и разнообразных реальных табличных данных в открытом доступе. Модель научилась обобщать закономерности, характерные для реальных данных.
В ходе тестирования TabFM показала высокую производительность по сравнению с существующими методами на различных наборах данных для классификации и регрессии. Модель доступна через репозитории Hugging Face и GitHub.