Долгое время считалось, что ускорить работу ИИ можно только одним способом — использовать более мощные чипы. Исследователи из Пекинского университета решили проверить другую идею. Вместо увеличения вычислительной мощности они изменили сам принцип обмена данными между процессорами. И, судя по результатам, эксперимент оказался удачным.

Созданная ими система объединила пять ПЛИС, каждая из которых отвечала за свой слой пятислойной свёрточной нейросети. Передача данных шла через кремниевые фотонные трансиверы со скоростью 400 Гбит/с и оптический коммутатор 16×16 с пропускной способностью до 6,4 Тбит/с. Любопытно, что при вычислительной мощности 1,97 Тфлопс против 16,96 Тфлопс у контрольного GPU система выполнила задачу шумоподавления почти в 149 раз быстрее.

Главная идея оказалась довольно простой. Вместо того чтобы постоянно записывать промежуточные результаты во внешнюю память, каждый чип сразу передавал их следующему по оптическому каналу. Благодаря этому удалось избавиться от одного из основных узких мест современных GPU. В итоге тысяча изображений размером 32×32 пикселя была обработана за 105,16 мкс вместо 15,643 мс, а загрузка вычислительных блоков достигла 94,7%.

Пока речь идёт только об эксперименте на сравнительно простой нейросети и наборе данных Fashion-MNIST. Но авторы считают, что такой подход можно масштабировать. Если это получится, дата-центры смогут выполнять ИИ-задачи быстрее и с меньшими затратами энергии — без постоянной гонки за всё более производительными ускорителями.