Xiaomi раскрывает подробности обучения MiMo-V2-Pro: 1T параметров модели, тысячи развернутых GPU

Сообщение Gate News, 24 апреля — руководитель команды большой языковой модели Xiaomi Луо Фули в подробном интервью раскрыла, что модель MiMo-V2-Pro в сумме имеет 1 триллион параметров и для обучения потребовала тысячи GPU. Она отметила, что масштаб 1T представляет собой минимальный порог для достижения производительности, приближающейся к уровню Claude Opus 4.6, и получения конкурентного входного билета на следующий этап ИИ-агентов.

Технически версия Pro использует механизм экстремально разреженного внимания с соотношением 7:1 между глобальным вниманием и вниманием в скользящем окне, чтобы контролировать затраты на инференс при обработке длинного контекста. Модель также сохраняет архитектуру MTP (Multi-Token Prediction), чтобы задействовать избыточную вычислительную мощность для более быстрого инференса.

Со стороны управления команда MiMo численностью 100 человек имеет лишь 30–40 сотрудников, непосредственно вовлеченных в ключевые итерации. Команда работает без формальных иерархий или явных делений на подгруппы и без фиксированных дедлайнов поставки. При столкновении с нестабильными численными проблемами, такими как всплески training loss, команда в первую очередь приостанавливает обучение для расследования, даже если это означает остановку работы на одну-две недели и понесение затрат в миллионы долларов на вычисления.

Отказ от ответственности: Информация на этой странице может поступать от третьих лиц и не отражает взгляды или мнения Gate. Содержание, представленное на этой странице, предназначено исключительно для справки и не является финансовой, инвестиционной или юридической консультацией. Gate не гарантирует точность или полноту информации и не несет ответственности за любые убытки, возникшие от использования этой информации. Инвестиции в виртуальные активы несут высокие риски и подвержены значительной ценовой волатильности. Вы можете потерять весь инвестированный капитал. Пожалуйста, полностью понимайте соответствующие риски и принимайте разумные решения, исходя из собственного финансового положения и толерантности к риску. Для получения подробностей, пожалуйста, обратитесь к Отказу от ответственности.

Связанные статьи

Хоскинсон обсуждает роль Midnight в экосистеме Cardano в выпуске The Breakdown

Чарльз Хоскинсон, основатель Cardano и сооснователь Ethereum, появился в качестве гостя в выпуске 701 подкаста «The Breakdown», который ведёт Дэвид Гокхштейн, чтобы обсудить проект Midnight, проблемы с пользовательским опытом в криптовалюте и его видение будущего блокчейна. Во время интервью Хоскинсон

CryptoFrontier5ч назад

Berkshire Energy видит возможность роста из-за спроса на электроэнергию, обусловленного ИИ-driven спросом

Согласно Beating, на собрании акционеров Berkshire генеральный директор Абель подчеркнул, что спрос на электроэнергию, формируемый с помощью ИИ, создает новые возможности роста для энергетического бизнеса компании: половина ее энергетических коммунальных предприятий уже обеспечивает электропитание, связанное с требованиями ИИ. В Айове дата-центры теперь составляют…

GateNews8ч назад

Свидетельские показания в первую неделю процесса Маска против Альтмана: признал, что XAI дистиллировала («выпаривала») OpenAI, и предупредил, что ИИ может стать как Терминатор

На первой неделе показаний в федеральном суде США в Окленде Илон Маск утверждал, что Аттман и Брокман мошеннически присвоили ранние средства некоммерческой организации, предупреждал о рисках «ИИ-апокалипсиса» и признался, что часть xAI он «перегнал» из моделей OpenAI; он рассказал, что вложил 38 млн долларов, и был свидетелем того, как OpenAI перешла из статуса некоммерческой структуры в компанию с оценкой 800 млрд долларов. Инвестиции Microsoft в 2022 году рассматриваются как поворотный момент в разрушении доверия. OpenAI заявляет, что Маск пытался переманить людей и пытается оправдаться конкурентными мотивами. Позже, на второй неделе, свидетелями выступили Расселл и Брокман.

ChainNewsAbmedia10ч назад

Связанный с Трампом ИИ-финансовый стартап покупает Block Street за 43 миллиона долларов

Согласно Fortune, AI Financial — криптовалютная компания, связанная с семьёй Трампа и ранее известная как Alt5 Sigma — на прошлой неделе приобрела Block Street, компанию в сфере криптоинфраструктуры, за 43 миллиона долларов. Мэтью Морган, советник AI Financial и генеральный директор Block Street, заявил, что приобретение было не…

GateNews10ч назад

Акции Riot подскочили на 8% после расширения сделки с AMD по центрам обработки данных

Акции майнера Bitcoin Riot выросли на 8% после расширения соглашения с AMD по дата-центрам. Расширенное партнерство включает улучшенные условия финансирования, подчеркивая стратегический сдвиг Riot от майнинга bitcoin к операциям дата-центров для искусственного интеллекта. Этот шаг сигнализирует о растущей уверенности

GateNews13ч назад

Миннесота запрещает инструменты для ИИ, создающие интимные изображения без согласия, и вводит штрафы до $500K

По данным Decrypt, законодательное собрание Миннесоты 2 мая приняло законопроект, запрещающий веб-сайтам и приложениям предоставлять AI-инструменты, которые генерируют не полученные с согласия интимные изображения идентифицируемых людей. Закон запрещает платформам разрешать пользователям получать доступ к таким инструментам «диджитал-двойников» или использовать их, а также запрещает размещение

GateNews15ч назад
комментарий
0/400
Нет комментариев