16 июля 2026 года китайская компания Moonshot AI выпустила Kimi K3. При 2,8 трлн параметров суммарно её подают как крупнейшую открытую модель в истории, и уже через несколько дней после запуска американские полупроводниковые акции распродавали, а представитель Белого дома публично обвинял компанию в дистилляции моделей Anthropic.

Загвоздка в том, что цифры — и даже сами формулировки — расходятся в зависимости от того, кто о них сообщает. В этой статье сверены публикаторы бенчмарков, деловая пресса, собственные объявления Moonshot и реальная страница на Hugging Face, и по ходу текста прямо указано, кто получил каждую цифру.

ГЛАВНОЕ
Производительность
Третье место в целом, первое в коде

57 баллов, третье место у Artificial Analysis на момент запуска. Первое место в Frontend Code Arena от Arena.ai. Но в общем зачёте модель не дотягивает ни до Fable 5, ни до GPT-5.6 Sol.

Цена
Вывод меняется вместе с базой сравнения

При $3 на входе и $15 на выходе она заметно дешевле Opus 4.8 и GPT-5.6 Sol. И при этом самая дорогая из китайских моделей — втрое дороже GLM-5.2.

Публикация весов
Открытые веса, которых ещё нет

Публикация намечена на 27 июля. На момент написания на Hugging Face всё ещё идёт обратный отсчёт, а лицензия не объявлена.

1. Что такое Kimi K3 — ключевые характеристики и компания

Kimi K3 — флагманская модель Moonshot AI, и API заработал 16 июля 2026 года (эта дата совпадает у ITmedia NEWS, OpenRouter и других источников). Компания основана в 2023 году, её поддерживают Alibaba и Tencent, а по данным Forbes последний раунд финансирования поднял её оценку выше $20 млрд (после $4,3 млрд и затем $10 млрд), при ARR в $200 млн по состоянию на апрель 2026 года.

2,8 трлн
Всего параметров. На момент запуска — крупнейшая модель из когда-либо заявленных к публичному выпуску
16 / 896
Эксперты MoE. На токен срабатывают лишь 16 из 896 (активировано менее 2%)
1 млн
Длина контекста (если точно — 1 048 576 токенов)
~1,4 ТБ
Реальный объём весов на диске при 4 битах (MXFP4). Moonshot рекомендует от 64 ускорителей

Источники: объявление Moonshot AI (в изложении ITmedia NEWS со ссылкой на разбор npaka) и практическая статья Northflank. Длина контекста и объём весов — измерения Northflank.

Два архитектурных нововведения получили собственные имена. Kimi Delta Attention (KDA) ускоряет декодирование на контекстах в миллион токенов; AINews сообщает об ускорении до 6,3 раза. А Attention Residuals (AttnRes) избирательно достаёт нужные представления из более ранних слоёв; та же статья оценивает выигрыш примерно в 25% эффективности обучения при менее чем 2% дополнительных затрат. Веса — MXFP4, активации — MXFP8, причём квантование не навешивали задним числом: обучение начиная с этапа SFT велось уже со встроенным квантованием.

🟡 Официальной цифры по активным параметрам нет. Обозначение «2.8T-A50B» (около 50 млрд активных) ходит по сети, но это оценка, выведенная из соотношения 16/896, а не число, опубликованное Moonshot: Northflank прямо отмечает, что компания никогда не называла количество активных параметров. Стоит помнить и о другом — ни OpenAI, ни Anthropic не раскрывают число параметров своих моделей, так что «2,8 трлн, крупнейшая в мире» верно лишь среди моделей, чьи размеры опубликованы.

2. Что на самом деле значит «третье место» — в каком рейтинге и на какую дату

Формулировка «третье место, сразу за свежими моделями OpenAI и Anthropic» в целом корректна. Но если не зафиксировать источник, дальше цифры перестают сходиться.

Основание — Intelligence Index от Artificial Analysis. В разборе от 17 июля 2026 года компания оценила Kimi K3 в 57 баллов, поставив её на третье место после Claude Fable 5 и GPT-5.6 Sol и признав её интеллект сопоставимым с Opus 4.8 и GPT-5.5. Для сравнения: в том же индексе GLM-5.2 набирает 51, а DeepSeek v4 Pro — 44.

⚠️ Одни и те же 57 баллов подают как 3-е, 4-е и 7-е место

В собственном анонсе Artificial Analysis говорится о третьем месте, в подсчёте Northflank — о четвёртом из 189 моделей, а живая страница той же компании показывает седьмое из 190. Балл (57) не менялся, значит расхождение идёт от того, что попадает в сравнение — считаются ли отдельно варианты с разным уровнем усилий рассуждения — и на какой момент сделан срез. Рейтинги двигаются ежедневно, поэтому «третье место» правильнее читать как снимок на 17 июля 2026 года.

На метриках, более близких к реальной работе, порядок выражен резче. Ниже — GDPval-AA v2 от Artificial Analysis: практические задачи оцениваются по шкале Эло, где человеческая планка принята за 1000.

МодельGDPval-AA v2 (Эло)Положение
Claude Fable 517601-е место
Kimi K31668Позади Fable 5 и Sol
Claude Opus 4.81600K3 обходит её
GLM-5.21514Лучшая из предыдущего поколения китайских моделей
GPT-5.51494
Kimi K2.6 (прошлое поколение)1190K3 выше на 478 баллов

Источник: Artificial Analysis (статья компании от 17 июля 2026 года). В AA-Briefcase, её закрытой агентной оценке, K3 тоже вторая после Fable 5 — Эло 1547, плюс 732 балла к прошлому поколению K2.6. В AutomationBench-AA модель занимает первое место с 53%.

По-настоящему важна не цифра «третье место», а размер скачка относительно прошлого поколения. С 1190 до 1668 в GDPval-AA v2 и +732 балла в AA-Briefcase. Рынок отреагировал на то, что китайская открытая модель за одно поколение подобралась вплотную к американскому фронтиру.

3. Кто проводил замеры — отделяем цифры вендора от независимых

Вес у результатов совершенно разный в зависимости от того, измерял ли их сам Moonshot или сторонняя организация. ITmedia разнесла эти два блока по отдельности, и эта статья следует той же практике.

Измерено самим Moonshot (данные вендора)
  • Program Bench: K3 77,8% (GPT-5.6 Sol 77,6%, Fable 5 76,8%)
  • SWE Marathon: K3 42,0% (второе место, у Opus 4.8 — 40,0%)
  • BrowseComp: K3 91,2% (GPT-5.6 Sol 90,4%)

Каждое преимущество минимально, и все они получены на собственных тестах вендора — читать их следует с этой поправкой.

Измерено независимыми сторонами
  • Frontend Code Arena (Arena.ai): K3 первая с 1679 (Fable 5 1631, GPT-5.6 Sol 1618). Модель лидирует в шести поддоменах из семи, поднявшись на 17 позиций с 18-го места, где была K2.6
  • GDPval-AA v2: K3 третья с 1668 (Artificial Analysis)
  • FrontierSWE: Fable 5 86,6% > K3 81,2%здесь K3 проигрывает
  • Vals Index: 74,70% (второе место из 38 моделей по подсчёту Northflank)

Результат, на который стоит обратить внимание: в FrontierSWE модель уступает Fable 5 на 5,4 пункта. Заголовки о победах в отдельных бенчмарках верны, но это не победа по всему фронту. Moonshot и сама признаёт, что в общем зачёте не дотягивает до Fable 5 и GPT-5.6 Sol (об этом ниже).

🟡 Методику подсчёта уже оспорили. Автор Program Bench указал, что Moonshot использовала среднюю долю реализации, а не число программ, доведённых до успешного выполнения. Предпринимательница в сфере ИИ Bindu Reddy отдельно настаивает, что нужна проверка на незагрязнённых закрытых оценках вроде LiveBench. Узкие преимущества по данным вендора стоит дисконтировать соответствующим образом.

4. Цена: вывод переворачивается в зависимости от базы сравнения

Kimi K3 стоит $3,00 на входе и $15,00 на выходе за миллион токенов ($0,30 за кэшированный вход). Поскольку оценка полностью меняется в зависимости от того, с чем сравнивать, взгляд лишь с одной стороны ведёт к неверному выводу.

Против западного фронтира → явно дешевле
  • Kimi K3: $3 / $15
  • Claude Opus 4.8: $5 / $25
  • GPT-5.6 Sol: $5 / $30

Примерно на 40% дешевле по входу и на 40-50% дешевле по выходу. Производительность уровня фронтира по цене ниже западной — неизменный аргумент Kimi, и в этой части он подтверждается.

Против китайских конкурентов → самая дорогая из всех
  • Kimi K3: $3 / $15
  • GLM-5.2: примерно треть от стоимости задачи у K3
  • DeepSeek V4 Pro: примерно одна двадцать третья от стоимости задачи у K3

Саймон Уиллисон, отмечая резкий рост цены относительно прежних моделей компании, называет её самой дорогой моделью, которую выпускала любая китайская ИИ-лаборатория.

Об одном стоит сказать прямо: это не второй шок DeepSeek. В январе 2025 года DeepSeek потряс рынок ценой на порядок ниже западной. K3 дешевле западных моделей на 40-50%, то есть в пределах того же порядка. Это не ценовой слом, а догоняющая производительность с умеренной скидкой.

При этом реальные расходы определяются не одним лишь тарифом за токен. Artificial Analysis измерила фактическую стоимость выполнения одной задачи в ходе прогона своего Intelligence Index.

Стоимость одной задачи по замерам Artificial Analysis (во время прогона Intelligence Index)

$0,94
Kimi K3
$1,04
GPT-5.6 Sol
$1,80
Claude Opus 4.8
$0,32
GLM-5.2
$0,04
DeepSeek V4 Pro

Источник: Artificial Analysis. По их замерам Kimi K3 потребовалось около 132 млн выходных токенов, чтобы пройти Intelligence Index, — меньше, чем примерно 166 млн у прошлого поколения K2.6. Тариф выше, но менее многословные рассуждения снижают итоговую сумму.

Дешевле Opus 4.8 и по прайс-листу, и по измеренной стоимости, но при этом самая дорогая из китайских моделей — вот полная картина по цене. Схема «китайская, значит копеечная» здесь не работает, но и списывать модель как дорогую тоже неверно, если сравнивать её с Западом.

5. Скачать пока никто не может — что с открытыми весами

Издания не сходятся даже в том, как её называть. VentureBeat выносит в заголовок «крупнейшую open-source-модель в истории», SCMP — «крупнейшую в мире open-source-модель ИИ», а Reuters пишет «open-weight». Технически верен именно второй вариант, и вот почему.

1. На момент написания веса не опубликованы

Репозиторий moonshotai/Kimi-K3 на Hugging Face всё ещё показывает обратный отсчёт, и ни одного файла safetensors в списке нет. Страница модели у Artificial Analysis тоже помечает её как проприетарную. Проверено 27 июля 2026 года — а это и есть намеченная дата публикации, так что к моменту вашего чтения ситуация почти наверняка изменилась. Пройдите по ссылке выше, чтобы увидеть текущее состояние.

2. Лицензия тоже не объявлена

По состоянию на 17 июля Northflank прямо пишет, что лицензия не объявлена. Пост в сообществе Hugging Face так же указывает её как TBD до выхода весов. Утверждение о «Modified MIT» — чужой домысел, перенесённый с поколения K2, и вопрос не решён.

3. Это в принципе не открытый исходный код

Обещаны обученные веса, а не обучающие данные и не код обучения. Точное название для такой схемы — открытые веса, и это не то же самое, что открытый исходный код в определении OSI.

Даже после публикации запустить это в одиночку не выйдет. При 4 битах (MXFP4) одни только веса занимают около 1,4 ТБ, а с запасом под KV-кэш и активации Northflank оценивает потребность примерно в восемь узлов по восемь GPU на 80 ГБ, тогда как Moonshot рекомендует супернод от 64 ускорителей. Модель не помещается ни на одну H100, H200 или B200, распределённый кластер обязателен, а продакшен-развёртывание фактически ограничено связкой Linux + NVIDIA. Это совсем не те персональные сборки, о которых идёт речь в материале про требования к железу для локальных LLM.

И всё же значение у этого огромное. Когда веса уровня фронтира спускаются на землю, организации, которым нельзя выпускать данные за свой периметр — регулируемые отрасли, госструктуры — могут запускать их у себя. Само существование публичной модели того же уровня меняет переговорную силу закрытых API. Из-за этого релиза приходится пересматривать и предпосылки материала о том, как выбирать открытую модель.

6. Насколько упали акции США — цифры расходятся от издания к изданию

Американские полупроводниковые акции действительно распродавали на неделе запуска. Но сообщаемые проценты падения у разных изданий не совпадают, поэтому здесь они приведены как диапазоны, а не как установленные факты.

Что двигалосьЗаявленное движениеИсточник и примечания
Nasdaq-1,5% в пятницу (худшая сессия недели)Yahoo Finance
Тайваньский рынокБолее -6%Там же
Японский рынокЗакрылся на -4%Там же
Полупроводниковый ETF (SMH)Падение более чем на 20% от максимума конца июняТам же
Филадельфийский полупроводниковый индекс (SOX)От -9% до -12,5% за неделю⚠️ Цифра различается от издания к изданию («12,5%, худшая неделя за 15 месяцев», «более 9%», «около 10%, сильнейшее падение с апреля 2025 года»)
Отдельные бумаги (17 июля)AMD -5%, Intel -4%, NVIDIA -3% (всё внутри дня, затем отыграно)24/7 Wall St.
Китайские ИИ-компании с листингом в ГонконгеZhipu -28,4%, MiniMax -15,6% (17 июля)Forbes. Китайские бумаги распродавали сильнее

Для сравнения: во время шока DeepSeek в январе 2025 года, к которому все апеллируют, Yahoo Finance сообщала, что одна только NVIDIA потеряла около $590 млрд капитализации за одну сессию. Сейчас NVIDIA просела на 3% внутри дня — масштаб совершенно иной.

🟡 Падение с тех пор отыграно

Позднее Yahoo Finance сообщила, что на рынок вышли покупатели просадки и чиповые акции сократили потери, а Bank of America спокойно оценил происходящее как всего лишь летнюю коррекцию. Аналитики тоже разошлись. Робин Чжу из Bernstein назвал K3 подтверждающим сигналом — ещё одной точкой в уже известном тренде сокращения разрыва китайскими лабораториями. Гэри Юй из Morgan Stanley, напротив, отметил, что K3 получила благосклонный приём во всём мире и показывает: китайские LLM догоняют американских лидеров сразу по масштабу модели, производительности и цене.

Ходит и цифра о том, что за три дня испарилось $470 млрд стоимости, связанной с ИИ, но она восходит к срочной заметке на криптоиздании и не подтверждается в крупной деловой прессе, поэтому в этой статье она не используется.

7. Обвинение в дистилляции и возражения на него

22-23 июля сюжет сместился из технологий в геополитику. Майкл Крациос, директор Управления по научно-технической политике Белого дома (OSTP), выдвинул против Moonshot два утверждения — об этом сообщили CNBC, The Hill, Yahoo News и другие.

Утверждение 1: доступ к подсанкционным чипам

Что Moonshot получила серверы с NVIDIA GB300 и имела доступ к GB300 в Таиланде, возможно используя их для обучения собственных моделей. GB300 относится к поколению Blackwell и не может законно продаваться в Китай.

Утверждение 2: дистилляция в промышленных масштабах

Что компания вела скрытую дистилляцию Fable от Anthropic в промышленных масштабах и даже построила отдельную платформу, которая ротировала способы доступа, чтобы уходить от обнаружения. Выступавший рядом Джейкоб Хелберг назвал это кражей ценной американской интеллектуальной собственности.

Возражение: даты не сходятся

Сотрудник Moonshot Рэнди Сянь иронично ответил в X, что Fable вышла публично 1 июля, а K3 — 15 июля, так что мы, выходит, обучили фронтир-модель с нуля за 15 дней — заявка на рекорд. Исследователь ИИ Брейден Хэнкок сказал TechCrunch, что Fable была доступна лишь с 1 июля и что дистиллировать такой объём данных, обучиться на нём и выпустить модель за две недели невозможно.

🔴 Никаких доказательств не обнародовано. По данным SCMP, несколько специалистов по ИИ назвали обвинение политическим и безрассудным и отметили, что выводы модели в принципе не охраняются авторским правом. Reuters со ссылкой на дипломатические телеграммы сообщила, что Госдепартамент ещё в апреле поручил посольствам информировать правительства стран пребывания о нарушениях интеллектуальной собственности китайскими ИИ-компаниями, и среди названных была Moonshot. Иначе говоря, эти обвинения появились раньше релиза K3, и никаких доказательств именно по K3 предъявлено не было.

Единой позиции у американской стороны тоже нет. NVIDIA публично раскритиковала Anthropic поимённо, заявив по поводу утверждений Anthropic о лазейках в экспортном контроле, что американским компаниям следует сосредоточиться на инновациях и принять вызов, а не рассказывать небылицы.

8. Слабые места — скорость, галлюцинации и собственная оценка Moonshot

За громкими заголовками о производительности теряются три слабости, которые бьют по продакшену.

🐢 Медленно (хотя замеры расходятся)

Живые замеры Artificial Analysis показывают 33 токена в секунду (145-е место из 190 моделей) и 177 секунд до первого токена. Northflank при этом сообщает о 62 токенах в секунду и 1,99 секунды. Основная часть разрыва — это перегрузка мощностей из-за колоссального спроса: OpenRouter держит на модели предупреждение о том, что мощности апстрима ограничены и ошибки 429 могут быть частыми.

🎭 Галлюцинаций стало больше

Artificial Analysis сообщает, что при выросшей точности доля галлюцинаций поднялась с 39% до 51%. Более высокий балл интеллекта — не то же самое, что фактологичность, и использовать эту модель без проверки нельзя.

📝 Moonshot сама признаёт отставание

Компания говорит о явной разнице в пользовательском опыте между своей моделью и Claude Fable 5 с GPT-5.6 Sol. Её собственный вывод: минимальный отрыв в бенчмарках и ощущения от модели в повседневной работе — две разные вещи.

9. Как попробовать модель уже сегодня

До выхода весов попробовать её можно тремя способами.

СпособПодробностиКому подходит
Официальное приложение Kimi / вебЧерез kimi.com. Есть бесплатный тарифВсем, кому нужно просто оценить качество
API Moonshot$3 на входе, $15 на выходе, $0,30 при попадании в кэш (за миллион токенов)Командам, встраивающим модель в свой продукт
Через OpenRouterOpenRouter. Тот же эндпоинт, через который вы уже вызываете другие моделиТем, кто сравнивает несколько моделей
Self-hostingПосле публикации весов (намечена на 27 июля). Рекомендация — от 64 ускорителей, плюс нужно планирование с учётом MoE в vLLM, TensorRT-LLM или SGLangОрганизациям, чьи данные не могут покидать периметр

Но держите в уме сказанное выше: мощности перегружены, и ошибки 429 обычны. Прежде чем целиком переводить продакшен-нагрузку, разумный подход — та же логика, что и при выборе между облаком и локальным запускомнаправить на модель часть трафика, предусмотрев запасной вариант.

10. Раскладка утверждений по степени достоверности

✅ Подтверждено в первоисточниках
  • API вышел 16 июля 2026 года; 2,8 трлн параметров всего; активны 16 экспертов из 896; 1 млн токенов
  • Цены API: $3 на входе, $15 на выходе, $0,30 за кэш
  • 57 баллов в Artificial Analysis Intelligence Index
  • 1668 в GDPval-AA v2 (Fable 5 = 1760, Opus 4.8 = 1600)
  • Первое место с 1679 в Frontend Code Arena
  • Стоимость задачи $0,94 против $1,80 у Opus 4.8
  • Доля галлюцинаций выросла с 39% до 51%
🟡 Источники расходятся или значение меняется
  • Место в Intelligence Index (в обращении и 3-е, и 4-е, и 7-е)
  • Недельное падение SOX (от -9% до -12,5%)
  • Скорость вывода (33 ток/с против 62 ток/с)
  • Активные параметры «около 50 млрд» (оценка, а не официальная цифра)
  • Лицензия «Modified MIT» (домысел по аналогии с K2)
🔴 Не решено, доказательств нет
  • Обвинение в дистилляции — публичных доказательств нет, исследователи отвергают его по срокам
  • Доступ к подсанкционным чипам — утверждение американского чиновника; ни официального ответа Moonshot, ни доказательств не опубликовано
  • Веса и лицензия — на момент написания не опубликованы (намечено на 27 июля)
  • «$470 млрд стоимости ИИ потеряно за три дня» — не подтверждается в крупной деловой прессе

Коротко: настоящий сюжет Kimi K3 — в том, что китайская открытая модель вышла на дистанцию удара от фронтира. Она добралась туда с ценой на 40-50% ниже западного фронтира, но без скидки на порядок; в общем зачёте она уступает Fable 5 и GPT-5.6 Sol; она медленная; и галлюцинирует чаще. И всё же за одно поколение она подняла GDPval-AA v2 на 478 баллов и обязалась опубликовать веса — именно на это и отреагировал рынок.

FAQ

Q1. Kimi K3 — это open source?

Нет. Запланирована публикация обученных весов, то есть открытые веса, а не публикация обучающих данных или кода обучения. Более того, на момент написания сами веса ещё не вышли: страница moonshotai/Kimi-K3 на Hugging Face по-прежнему показывает обратный отсчёт, а лицензия не объявлена. Публикация намечена на 27 июля 2026 года.

Q2. Она действительно третья по бенчмаркам?

Основание — 57 баллов и третье место в Intelligence Index от Artificial Analysis, после Claude Fable 5 и GPT-5.6 Sol; на 17 июля 2026 года это прочтение верно. Но существуют и подсчёты, ставящие те же 57 баллов на четвёртое и седьмое место, потому что результат зависит от того, как очерчен набор для сравнения и на какой момент сделан срез. Читайте «третье место» как снимок. В ориентированной на код Frontend Code Arena модель первая, а в FrontierSWE она проигрывает Fable 5.

Q3. Она правда дешёвая?

Ответ переворачивается в зависимости от базы сравнения. При $3 на входе и $15 на выходе за миллион токенов она примерно на 40% дешевле по входу и на 40-50% дешевле по выходу, чем Claude Opus 4.8 ($5/$25) или GPT-5.6 Sol ($5/$30), так что против западного фронтира она явно недорога. Измеренная стоимость это подтверждает: $0,94 за задачу против $1,80 у Opus 4.8 (Artificial Analysis). Зато среди китайских конкурентов она самая дорогая в группе — примерно втрое дороже GLM-5.2 и в 23 раза дороже DeepSeek V4 Pro. Саймон Уиллисон называет её самой дорогой моделью, выпущенной какой-либо китайской ИИ-лабораторией. Это не скидка на порядок, какой был шок DeepSeek.

Q4. Почему упали акции США?

Из-за опасений, что дешёвые китайские модели снизят спрос на дорогие вычисления. На неделе запуска Nasdaq упал на 1,5% в пятницу, Тайвань — более чем на 6%, Япония — на 4%, а полупроводниковый ETF (SMH) потерял свыше 20% от максимума конца июня. Тем не менее затем чиповые акции сократили потери, когда на рынок вышли покупатели просадки, а Bank of America назвал это всего лишь летней коррекцией. Масштаб отличается от шока DeepSeek, когда в январе 2025 года одна только NVIDIA потеряла около $590 млрд за один день.

Q5. Правда ли, что они украли модель Anthropic?

Никаких доказательств не обнародовано. Директор OSTP Белого дома Майкл Крациос заявил о дистилляции Fable от Anthropic в промышленных масштабах, но Moonshot это отрицает, указывая на 15-дневный промежуток между публичным релизом Fable 1 июля и запуском K3 15 июля. Исследователь ИИ Брейден Хэнкок так же сказал TechCrunch, что дистиллировать, обучить и выпустить модель за две недели невозможно. По данным SCMP, несколько специалистов раскритиковали обвинение как политическое. Материала, чтобы вынести вердикт, на данный момент недостаточно.

Q6. Смогу ли я запустить её на своём ПК?

Нет. Даже при 4-битном квантовании (MXFP4) одни только веса весят около 1,4 ТБ, что не поместится ни на одну H100, H200 или B200. Northflank оценивает потребность примерно в восемь узлов по восемь GPU на 80 ГБ, а Moonshot рекомендует от 64 ускорителей. macOS и Windows для продакшена не рассматриваются: предполагается Linux с NVIDIA. Это совершенно иной масштаб по сравнению с тем, как запустить локальную LLM самостоятельно.

Q7. Стоит ли использовать её в продакшене?

Переходить целиком и сразу не стоит по трём причинам: (1) мощности перегружены, и ошибки 429 могут быть частыми (собственное предупреждение OpenRouter); (2) доля галлюцинаций выросла с 39% до 51%; (3) Moonshot сама признаёт явное отставание в пользовательском опыте от Fable 5 и GPT-5.6 Sol. Реалистичный путь — сохранить запасной вариант и пропускать через неё часть трафика в той области, где она сильна, например в генерации фронтенд-кода, а затем сравнить.

Q8. Насколько она лучше прежней K2.6?

Настоящий сюжет здесь — величина скачка. В GDPval-AA v2 от Artificial Analysis модель прошла путь с 1190 до 1668, то есть плюс 478 баллов, а в закрытой агентной оценке той же компании AA-Briefcase прибавила 732 балла. В Frontend Code Arena от Arena.ai она поднялась на 17 позиций, с 18-го места на 1-е. Рынок отреагировал не столько на абсолютное место, сколько на то, сколько дистанции она отыграла за одно поколение.

Похожие статьи