Бывший директор по ИИ Tesla создал модель, превосходящую GPT-2
Андрей Карпати, ранее возглавлявший направление ИИ в Tesla, разработал модель, которая по результатам тестирования превосходит GPT-2, потратив на это всего лишь $73 и три часа, используя один из восьми GPU H100. Для сравнения, оригинальная GPT-2 с 1,5 миллиарда параметров, которая была создана OpenAI в 2019 году, потребовала более недели и около $43,000 для тренировки на 32 TPU v3. Снижение затрат в 600 раз за семь лет стало возможным благодаря значительным улучшениям: более быстрому оборудованию, оптимизированному программному обеспечению и новым алгоритмическим подходам, а также качественным данным, использованным при обучении. Каждый год Карпати прогнозирует, что стоимость обучения таких моделей снижается на 40%. Его новый проект nanochat с 768 миллионами параметров отличается современными архитектурными решениями и уместился в 1000 строк кода. Также Карпати создал лидерборд, где участники могут соревноваться за рекорды по обучению моделей. Текущий лучший результат — 3,04 часа.