Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar #1502
bitcompool
started this conversation in
Proposals
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production bar
Всем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.
Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.
Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.
Результаты для Prompt
Модель | Автоматическая проверка | Слепая оценка | Стоимость 32 запросов | Медианная задержка -- | -- | -- | -- | -- GPT-5.4 Mini | 32/32 | 12/12 | $0.026675 | 1.20 с DeepSeek V4 Flash | 30/32 | 8/12 | $0.000890 | 1.10 с Mistral Small | 29/32 | 6/12, ещё 2 не оценены | $0.003115 | 0.76 с Gonka24 / Kimi K2.6 | 29/32 | 7/12 | $0.015254 | 30.77 сПолные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.
Особенно показателен результат Gonka Advisor. Формально Kimi получила
30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только2/12ответов против11/12у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.
У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с
8×H200или8×B200и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня4×A100/H100или2×H200/B200и около 320 ГБ VRAM на ML Node. (Gonka)При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. (gonka24.com)
Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.
Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.
Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.
## Обратная связь от разработчика: почему текущий модельный ряд Gonka пока не проходит production barВсем привет! Я разработчик AI-продукта Prompt Perfect. Сейчас я выбираю API-провайдера для двух production-функций: улучшения пользовательских промптов и анализа их качества.
Мне действительно хочется поддержать Gonka, использовать децентрализованную инфраструктуру и направлять в сеть реальный API-трафик. Поэтому я провёл полноценное сравнительное исследование GPT-5.4 Mini, DeepSeek V4 Flash/Pro, Mistral Small и Gonka24 с Kimi K2.6.
Тестирование включало фиксированные наборы из 32 кейсов для Prompt и 32 кейсов для Advisor, автоматические проверки контракта, отдельный holdout и слепую ручную оценку качества.
Результаты для Prompt
Результаты для Advisor
Полные результаты показывают, что GPT остаётся единственным вариантом, который одновременно даёт высокую формальную надёжность и хорошее реальное качество.
Особенно показателен результат Gonka Advisor. Формально Kimi получила
30/32, то есть сравнялась с GPT. Но в слепой оценке прошли только2/12ответов против11/12у GPT. Модель регулярно запрашивала необязательные детали, допускала ошибки с защищёнными значениями и нарушала границы контракта. Иными словами, JSON выглядел правильно, но пользовательское качество оставалось слабым.Кроме того, Gonka оказалась приблизительно в 26 раз медленнее GPT для Prompt и в 16 раз медленнее для Advisor. При этом она лишь примерно в 1.7–2.4 раза дешевле GPT. На фоне DeepSeek Flash, который стоил примерно в 30 раз дешевле GPT на Prompt при практически такой же скорости, текущее предложение Gonka выглядит неконкурентоспособным.
У меня также вызывает вопрос выбор моделей для сети с такими высокими требованиями к оборудованию. В официальной документации для Kimi K2.6 указывается референсная конфигурация от двух ML Nodes, каждый примерно с
8×H200или8×B200и 640 ГБ VRAM. Для MiniMax M2.7 указаны конфигурации уровня4×A100/H100или2×H200/B200и около 320 ГБ VRAM на ML Node. (Gonka)При таком уровне оборудования логично ожидать, что сеть будет предоставлять действительно передовые и конкурентоспособные модели. Поэтому я не понимаю, почему основной каталог сейчас фактически строится вокруг Kimi K2.6 и MiniMax M2.7. MiniMax M2.7 я в этом конкретном исследовании не тестировал, поэтому не буду делать выводы о её качестве, но сам выбор и ширина модельного ряда вызывают вопросы. Gonka24 сейчас публично предлагает именно Kimi K2.6 и MiniMax M2.7. ([gonka24.com]2)
Моя просьба к комьюнити и governance Gonka: рассмотрите возможность запуска более современных, быстрых и конкурентоспособных моделей. Например, даже DeepSeek V4 Flash, который тоже не прошёл мой строгий production bar, оказался намного дешевле, быстрее и немного сильнее Kimi в Prompt-задачах.
Пожалуйста, воспринимайте это сообщение не как нападение или критику ради критики. Это реальный опыт разработчика, который действительно хочет использовать Gonka API, поддерживать экосистему и направлять в неё production-трафик.
Но для этого модельный каталог должен соответствовать уровню оборудования, которое предоставляет сеть. Сейчас главное ограничение Gonka для моего продукта не API и не цена, а качество моделей и огромная задержка. Я искренне надеюсь, что проект начнёт запускать более современные и конкурентоспособные модели. Тогда у разработчиков появится реальная причина выбирать Gonka не только из идеологических соображений, но и по качеству продукта.
All reactions