Итоги первой недели бенчмарка Alpha Arena: успехи и провалы ИИ в криптоторгах

По итогам первой недели эксперимента Alpha Arena, в рамках которого шесть различных ИИ активно торговали криптовалютой на реальные деньги, только две китайские модели — Qwen3 и DeepSeek V3.1 — продемонстрировали прибыль. Остальные, такие как Grok 4 и Claude Sonnet 4.5, завершили неделю с небольшими потерями, а Gemini 2.5 Pro и GPT-5 оказались на грани банкротства. Каждой модели было выделено по 10 тысяч долларов для торговли, основанной исключительно на техническом анализе, без учета новостного фона. Лидером по итогам недели стал Qwen3, который увеличил свой капитал до 17 500 долларов, что соответствует росту на 75%. DeepSeek V3.1 также показал неплохие результаты с 13 500 долларов. В то же время, капитал Gemini 2.5 Pro упал до 3 300 долларов, а GPT-5 — до 2 800 долларов. Alpha Arena дает уникальную возможность оценить способности ИИ в условиях волатильного рынка, где ключевыми факторами успеха являются управление рисками и эмоциональная устойчивость. Бенчмарк продлится несколько недель, после чего начнется новый сезон.

Вопрос-ответ

Какие результаты показали участники бенчмарка Alpha Arena за первую неделю?

Из шести ИИ моделей две китайские — Qwen3 и DeepSeek V3.1 — принесли прибыль. Остальные: Grok 4 и Claude Sonnet 4.5 завершили неделю с небольшими потерями, а Gemini 2.5 Pro и GPT-5 оказались близко к банкротству. Лидером стал Qwen3 с ростом капитала на 75% (до 17 500 долларов), DeepSeek V3.1 — до 13 500 долларов, Gemini 2.5 Pro упал до 3 300 долларов, GPT-5 — до 2 800 долларов.

На чем основывалась торговля ИИ в эксперименте?

Торговля осуществлялась исключительно на техническом анализе с начальным капиталом по 10 000 долларов на каждую модель. Новостной фон не учитывался, чтобы проверить способности ИИ в условиях чисто технического подхода и рыночной волатильности. Бенчмарк призван оценить риск-менеджмент и эмоциональную устойчивость в реальных рыночных условиях.

Какова текущая динамика и планы на продолжение бенчмарка?

После первой недели часть моделей демонстрирует устойчивый рост (Qwen3 и DeepSeek V3.1), в то время как другие столкнулись с потерями. Бенчмарк продлится несколько недель, после чего начнется новый сезон, что позволит сравнить тренды и корректировки стратегий между командами.

Вам также может понравиться...