Технологическая компания «Яндекс» представила сообществу разработчиков два новых решения в области искусственного интеллекта, чьи параметры составляют 35 млрд и 80 млрд. Новинки, которые, по заявлениям организации, были обучены с чистого листа, имеют разную специализацию: если первая модель ориентирована на работу с текстами и поиск данных, то вторая способна справляться с комплексными вычислениями, включая инженерные задачи и математику.
Директор по развитию технологий искусственного интеллекта «Яндекса» Александр Крайнов подчеркнул преимущество малого масштаба моделей при работе с внешними источниками. По его словам, в сценариях, где ИИ должен анализировать сторонние документы для формирования ответа, а не полагаться только на внутренние знания, такие инструменты демонстрируют скорость, сопоставимую с гигантами индустрии, практически не теряя в качестве.
Стратегия «Яндекса» строится на поиске баланса между эффективностью и стоимостью вычислительных мощностей. Компания делает ставку на высокотехнологичные, но относительно небольшие архитектуры, чтобы минимизировать расходы ресурсов без ущерба для точности. При этом создание модели на 80 млрд параметров потребовало колоссальных временных затрат — с учетом этапа предварительных тестов процесс обучения растянулся более чем на один год.
Отдельно Александр Крайнов прокомментировал недавние высказывания руководителя «Сбера» Германа Грефа, который предположил, что «Яндекс» использует дообученную китайскую модель Qwen. Представитель «Яндекса» пояснил, что запуск собственных разработок не был реакцией на критику со стороны конкурента. Главной задачей компании остается развитие собственных технологических решений для поддержания статуса одного из мировых лидеров в сфере ИИ.
