Во время обработки каждого фрагмента текста Kimi K3 задействует 104 млрд параметров, а не все 2,8 трлн. Для этого используется архитектура Mixture-of-Experts: из 896 экспертов выбираются 16. Такой подход снижает вычислительную нагрузку, но полные веса все равно должны находиться в памяти или быть доступны системе.
Веса хранятся в четырехбитном формате MXFP4. Простой расчет дает около 1,4 ТБ только для 2,8 трлн четырехбитных значений. Реальной системе понадобится больше памяти из-за коэффициентов квантования, служебных данных, кеша контекста и промежуточных вычислений. Контекст заявлен на уровне 1 048 576 токенов, что дополнительно повышает требования при длинных запросах.

Открытая публикация Kimi K3 полезна исследовательским центрам, облачным площадкам и компаниям, способным собрать многосерверную конфигурацию. Для владельца рабочей станции практичнее остается API: открытые веса дают контроль над моделью, но не делают ее доступной для запуска на нескольких потребительских видеокартах.








