Компания Яндекс представила два новых решения в области искусственного интеллекта, сосредоточив усилия на создании эффективных моделей с объемом 35 и 80 миллиардов параметров. Новинки, которые были обучены с нуля, имеют разную специализацию: первая ориентирована на работу с поисковыми запросами и сжатие текстовых данных, в то время как вторая предназначена для решения комплексных задач, включая математические расчеты и инженерные вычисления.
Стратегия технологического гиганта строится на оптимизации вычислительных мощностей. В Яндекс стремятся достичь высокого качества ответов при минимальных затратах ресурсов, делая ставку на компактные, но высокопроизводительные архитектуры. По словам директора по развитию технологий искусственного интеллекта Яндекса Александра Крайнова, модель меньшего размера идеально подходит для ситуаций, когда нейросеть должна анализировать внешние источники вместо использования собственной памяти. В таких сценариях использование небольших моделей позволяет сохранявать высокую скорость работы, практически не уступая в точности гораздо более масштабным системам.
Создание столь сложных инструментов требует колоссальных временных затрат: процесс обучения версии на 80 миллиардов параметров, с учетом всех предварительных этапов и экспериментов, растянулся более чем на один год.
При этом Александр Крайнов прокомментировал недавние высказывания руководителя Сбера Германа Грефа, который ставил под сомнение самостоятельность разработок Яндекса, предполагая использование китайской модели Qwen. Представитель компании подчеркнул, что выход новых моделей не является реакцией на подобные обвинения. Главной задачей для разработчиков остается развитие собственных технологий и удержание позиций в числе мировых лидеров индустрии искусственного интеллекта.
