Accueil Services Architecture Avantages Scénarios À propos Retour au site principal Espace Membre
Cluster GPU en ligne
Modèles prêts
Disponibilité API 99.99%

200+ Modèles, Calcul massif, Une seule API pour tout

DeepSeek·GLM·Qwen·Kimi·Llama entièrement intégrés, plateforme de calcul AI de niveau entreprise

Liste des modèles

Tous les modèles disponibles d'un coup d'œil

101+ modèles pré-intégrés, modèles clés listés ci-dessous, mis à jour en continu

Modèle Paramètres Longueur de contexte Précision Prix d'entrée (réf.) Prix de sortie (réf.) Statut
GPT-4.1 mini OpenAI1M¥2.80 /百万Token¥11.20 /百万TokenEn ligne
GPT-4.1 Populaire1M¥14.00 /百万Token¥56.00 /百万TokenEn ligne
o3 Raisonnement200K¥14.00 /百万Token¥56.00 /百万TokenEn ligne
Claude Sonnet 4.5 Anthropic200K¥21.00 /百万Token¥105.00 /百万TokenEn ligne
Claude Haiku 3.5 Anthropic200K¥5.60 /百万Token¥28.00 /百万TokenEn ligne
Gemini 2.5 Pro Google1M¥8.75 /百万Token¥70.00 /百万TokenEn ligne
Gemini 2.5 Flash Google1M¥1.05 /百万Token¥4.20 /百万TokenEn ligne
DeepSeek-V4 Pro Nouveau685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenEn ligne
DeepSeek-V4 Flash Nouveau685B MoE128KBF16¥0.50 /百万Token¥1.00 /百万TokenEn ligne
DeepSeek-R1 Raisonnement685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenEn ligne
GLM-5 智谱200B+128KBF16¥1.00 /百万Token¥6.00 /百万TokenEn ligne
GLM-5V-Turbo 多模态130B+128KBF16¥1.50 /百万Token¥3.00 /百万TokenEn ligne
Qwen3.7 Max Nouveau397B MoE128KBF16¥2.00 /百万Token¥6.00 /百万TokenEn ligne
Qwen3.6 Flash Rapide235B MoE128KBF16¥0.30 /百万Token¥0.60 /百万TokenEn ligne
Qwen3-Coder-Next Code235B MoE128KBF16¥1.50 /百万Token¥3.50 /百万TokenEn ligne
Kimi-K2.5 Nouveau1T MoE256KBF16¥2.50 /百万Token¥5.00 /百万TokenEn ligne
Kimi-K2 Thinking Raisonnement1T MoE256KBF16¥3.00 /百万Token¥6.00 /百万TokenEn ligne
MiniMax-M2.5 Nouveau456B MoE1MBF16¥2.00 /百万Token¥4.00 /百万TokenEn ligne
MiniMax-M2.5 Highspeed Rapide456B MoE1MBF16¥1.00 /百万Token¥2.00 /百万TokenEn ligne
Doubao Seed 2.0 Pro 豆包128KBF16¥1.50 /百万Token¥3.00 /百万TokenEn ligne
Doubao Seed 2.0 Code Preview Code128KBF16¥1.00 /百万Token¥2.00 /百万TokenEn ligne
Llama-4 Meta400B MoE1MBF16¥2.50 /百万Token¥5.00 /百万TokenEn ligne
Yi-Lightning 零一万物64KBF16¥0.50 /百万Token¥1.50 /百万TokenEn ligne
Step-2 阶跃星辰128KBF16¥1.50 /百万Token¥3.20 /百万TokenEn ligne
Hy3 Preview 混元128KBF16¥1.00 /百万Token¥2.00 /百万TokenEn ligne
BAAI/bge-m3 Embedding568M8KFP16¥0.02 /百万TokenEn ligne
Cas d'utilisation

Une commande, déployez votre IA

Explorez les solutions de déploiement d'infrastructure AI de KHB dans tous les secteurs, à la manière des développeurs

enterprise-ai.sh
$ khb deploy --scenario=enterprise --model=DeepSeek-V3.2
算力资源分配完成
模型加载完成 DeepSeek-V3.2
API网关配置完成
企业AI平台已就绪
ENDPOINT: https://api.khb.com/v1/enterprise
STATUS: RUNNING
compute-center.sh
$ khb deploy --scenario=compute --chip=ascend,nvidia
异构算力统一纳管启动
NVIDIA A100 × 128 已接入
昇腾910B × 64 已接入
弹性调度引擎就绪
UTILIZATION: 94.7%
finance.sh
$ khb deploy --scenario=finance --security=private
Déploiement privé环境初始化
数据隔离策略已启用
全链路加密传输已开启
Journaux d'audit系统就绪
COMPLIANCE: PASSED
manufacturing.sh
$ khb deploy --scenario=manufacturing --instance=reserved
预留实例资源锁定
工业AI模型部署完成
7×24 SLA保障已启用
质检模型推理延迟 <50ms
UPTIME: 99.99%
Instances réservées

Verrouillez le calcul, sécurisez votre activité

Calcul réservé dédié · Précision du modèle garantie · Coûts maîtrisés · SLA entreprise

DeepSeek-V3.2
deepseek-ai/DeepSeek-V3.2
Prix ¥594,000/组/月
Prix unitaire effectif ¥2.20/M tokens
TPM 1,250万
TTFT 1,600ms
TPS 45
Contexte 1M
Adapté au raisonnement complexe et à l'analyse décisionnelle de niveau entreprise, à la génération de code et à l'assistance au développement logiciel, à l'appel d'outils d'agents
GLM-5
zai-org/GLM-5
Prix ¥594,000/组/月
Prix unitaire effectif ¥2.75/M tokens
TPM 1,000万
TTFT 1,500ms
TPS 30
Contexte 1M
Adapté au développement d'agents de niveau entreprise, à la planification de tâches complexes et à l'exécution multi-étapes, à l'automatisation de l'ingénierie logicielle
Kimi-K2.5
moonshotai/Kimi-K2.5
Prix ¥594,000/组/月
Prix unitaire effectif ¥6.88/M tokens
TPM 400万
TTFT 1,500ms
TPS 30
Contexte 256K
Adapté au développement d'agents multimodaux de niveau entreprise, à la compréhension et à l'analyse de contenu visuel, à l'automatisation de tâches complexes
MiniMax-M2.5
MiniMaxAI/MiniMax-M2.5
Prix ¥297,000/组/月
Prix unitaire effectif ¥2.75/M tokens
TPM 500万
TTFT 500ms
TPS 30
Contexte 1M
Adapté à l'analyse de documents longs et de bases de connaissances de niveau entreprise, au service client intelligent et à la génération de contenu, à l'automatisation des processus métier
* Prix unitaire effectif basé sur le TPM, calculé avec 30 jours/mois et 50% d'utilisation globale. Données de performance basées sur des paramètres d'inférence typiques : 24K Token en entrée, 1K Token en sortie, taux de succès cache 80%. (Mis à jour le 20 mai 2026)
Passerelle AI

Passerelle de service LLM privée

Gestion unifiée · Routage intelligent · Limitation de débit · Observabilité chaîne complète

01 Accès multi-modèles unifié
Accès one-stop et appel standardisé de modèles de différents fournisseurs, supportant les interfaces compatibles OpenAI, éliminant la gestion ponctuelle, gérant facilement l'écosystème multi-fournisseurs
02 Routage intelligent & équilibrage de charge
Routage dynamique intelligent combinant les caractéristiques de trafic et les caractéristiques de service LLM, équilibrage de charge, basculement Fallback, garantissant la stabilité du service et le SLA métier
03 Gouvernance fine & limitation de débit
Configuration des autorisations de modèles, gestion du trafic et des quotas par utilisateur, API Key, projet, dimensions organisation, isolation multi-locataire, réalisant une gouvernance fine des appels de modèles
04 Comptabilité précise des coûts
Transparence des coûts chaîne complète à travers les utilisateurs consommateurs, API Keys, projets, organisations, modèles et calcul, réalisant une comptabilité précise des coûts et un contrôle budgétaire
05 Observabilité des modèles chaîne complète
Observabilité multi-dimensionnelle du volume d'appels de modèles, des performances et autres métriques, supportant la gouvernance précise des modèles, la gestion du cycle de vie et l'ajustement des stratégies de routage, supportant les tests A/B et les déploiements canari
06 Sécurité des données entreprise
Filtrage en temps réel des risques de confidentialité par désensibilisation bidirectionnelle, interception de contenu sensible liée et journaux d'audit, garantissant que chaque transaction métier LLM est conforme et traçable
Sécurité & Conformité

Système de défense en profondeur de bout en bout

Sécurité pilotée par l'intelligence, protection chaîne complète des données aux applications

🔐
Chiffrement de bout en bout
Transmission chiffrée TLS chaîne complète, chiffrement de stockage de données, système de gestion des clés, garantissant la sécurité absolue des données en transit et au repos
🛡️
Désensibilisation bidirectionnelle
Filtrage de désensibilisation bidirectionnel en temps réel entrée/sortie, identification et masquage automatiques des informations sensibles, prévention des fuites de données de confidentialité
📋
Journaux d'audit
Audit des opérations chaîne complète, chaque appel API traçable et auditable, répondant aux exigences de conformité dans les secteurs financier, médical et autres
🏢
Isolation multi-locataire
Isolation stricte des données entre locataires, contrôle d'autorisation fin, supportant le contrôle d'accès multi-dimensionnel par organisation, projet et utilisateur
🔒
Déploiement privé
Les données ne quittent jamais le domaine, toute l'inférence est effectuée au sein de l'intranet de l'entreprise, répondant aux exigences les plus strictes de souveraineté des données et de conformité
🚨
Détection de sécurité de contenu
实时防御潜在攻击,Détection de sécurité de contenu准确率超99%,敏感内容自动拦截,保障输出合规
Partenariat

Modèles de collaboration flexibles

Que vous ayez du calcul ou que vous en ayez besoin, KHB propose des solutions de partenariat adaptées

🤝 Opérations conjointes
Adapté à ceux qui ont des ressources de calcul et souhaitent acquérir rapidement des capacités de service Token, et servir les clients finaux ensemble avec KHB
Partenaires typiques
Opérateurs IDC, centres de calcul intelligents régionaux, fournisseurs de services cloud GPU, fabricants de puces nationaux
Avantages valeur
✓ Capacité complète de production Token, pas besoin de constituer votre propre équipe technique
✓ À calcul équivalent, débit d'inférence significativement amélioré
✓ Partage de revenus basé sur le volume de service réel
✓ Endorsement de marque KHB et support commercial
⚡ Absorption de calcul / Compute-as-a-Service
Adapté à ceux qui ont des clusters GPU auto-construits et souhaitent améliorer l'efficacité d'inférence, réduire les coûts O&M, ou convertir les ressources redondantes en revenus de service Token
Partenaires typiques
Clients gouvernementaux/entreprise avec calcul auto-construit, grandes entreprises internet, institutions financières, opérateurs télécoms
Avantages valeur
✓ Efficacité d'inférence significativement améliorée, calcul équivalent supportant une échelle métier plus grande
✓ Performance GPU pleinement utilisée, résolvant les défis d'adaptation
✓ Les données fonctionnent dans votre propre environnement, répondant aux exigences de conformité de sécurité
✓ Le calcul redondant peut fournir des services Token à l'externe, générant des revenus supplémentaires
Architecture technique

Architecture de flux de données du calcul à l'application

Architecture à quatre couches, les données circulent de gauche à droite, collaboration couche par couche, construisant une boucle fermée d'infrastructure AI d'entreprise

Layer 01
Couche de ressources de calcul
NVIDIA A100/H100
Huawei Ascend 910B
Muxi GPU
Moore Threads GPU
Layer 02
Couche de service d'inférence
Chargement & ordonnancement de modèles
Optimisation KV Cache
Continuous Batching
Quantification & accélération
Layer 03
Couche de passerelle API
Interface compatible OpenAI
Passerelle de routage intelligent
Limitation de débit et disjonction
Mesure et facturation Token
Layer 04
Couche applicative
Service client intelligent
Génération de contenu
Analyse de données
Solutions sectorielles
0
Modèles pré-intégrés
0
Support d'architectures puces
0
Réduction de latence d'inférence %
0
Amélioration du débit x
Services clés

Matrice de services autour du cœur KHB·AI

Quatre services orbitent autour du cœur, du calcul sous-jacent à la passerelle supérieure, couverture chaîne complète des besoins d'infrastructure AI d'entreprise

KHB·AI
INFRASTRUCTURE
Opérations de calcul
Token Factory
Opérations de calcul GPU, convertissant efficacement les ressources GPU en productivité Token. Supporte NVIDIA et puces nationales, réalisant un accès unifié et un ordonnancement élastique de calcul multi-architecture
🔒
Instances réservées
Reserved Instances
Calcul réservé dédié, ressources exclusives garantissant un fonctionnement métier stable, précision du modèle garantie, coûts maîtrisés, engagement SLA entreprise
🏗️
Plateforme MaaS
Enterprise MaaS
Plateforme de solution AI one-stop, gestion de calcul hétérogène, formation de modèles, couverture complète du processus de déploiement d'inférence, plus de 100 modèles pré-intégrés, prêts à l'emploi
🌐
Passerelle AI
AI Gateway
Passerelle de service LLM privée, gestion d'accès multi-modèles unifiée, routage intelligent et limitation de débit, observabilité chaîne complète, sécurité des données entreprise assurée
Opérations de calcul
TOKEN FACTORY
GPU算力运营,将GPU资源高效转化为Token生产力。支持NVIDIA及国产芯片(昇腾、沐曦、摩尔线程),实现多架构算力统一接入与弹性调度
🔒
Instances réservées
RESERVED INSTANCES
专属预留算力,独占式资源保障业务稳定运行。模型精度有保障,成本可控,企业级SLA承诺
🏗️
Plateforme MaaS
ENTERPRISE MAAS
Plateforme de solution AI one-stop, gestion de calcul hétérogène, formation de modèles, couverture complète du processus de déploiement d'inférence, plus de 100 modèles pré-intégrés, prêts à l'emploi
🌐
Passerelle AI
AI GATEWAY
Passerelle de service LLM privée, gestion d'accès multi-modèles unifiée, routage intelligent et limitation de débit, observabilité chaîne complète, sécurité des données entreprise assurée
Avantages

Pourquoi choisir KHB

Les chiffres ne mentent pas, chaque métrique est une preuve de force

0
Modèles pré-intégrés
DeepSeek, GLM, Qwen, Kimi, GPT-4.1, Claude, Gemini et autres LLM majeurs mondiaux accessibles en un clic, mises à jour dynamiques des miroirs de modèles, nouveaux modèles adaptés immédiatement, API prête à appeler
0
Réduction de latence d'inférence
自研推理加速引擎,KV Cache深度优化与Continuous Batching,首Token延迟降低70%,无损精度动态量化,推理计算量减少60-80%
0
Amélioration du débit
异构算力弹性调度,单卡Token产出深度优化,同等算力下Amélioration du débit3至5倍,GPU集群利用率提升300%
0
Support d'architectures puces
Support simultané de NVIDIA A100/H100, Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, gestion unifiée et ordonnancement intelligent multi-architecture, évitant le verrouillage fournisseur unique
0
SLA de disponibilité de service
Engagement SLA entreprise de 99,9% de disponibilité, déploiement multi-AZ, basculement automatique et dégradation Fallback, support technique 7x24 assurant la continuité d'activité
0
Détection de sécurité de contenu
Désensibilisation bidirectionnelle实时过滤隐私风险,Détection de sécurité de contenu准确率超99%,联动敏感内容拦截与Journaux d'audit,数据泄露风险降低99%
0
Démarrage rapide
可视化配置界面,3分钟内完成操作,30+开箱即用预置模板,Interface compatible OpenAI,无需深厚技术背景即可跨场景调用
0
Livraison d'instances réservées
Instances réservées standard déployées sous 1 à 7 jours ouvrés, la plateforme gère le déploiement de modèles et la vérification des performances, support d'optimisation des performances d'inférence, garantissant un onboarding métier stable
Questions fréquentes

Questions fréquentes

Quelle est la force technique de l'infrastructure AI de KHB ?
KHB possède des moteurs d'opérations de calcul AI et d'accélération d'inférence développés en interne, avec des capacités techniques clés incluant la gestion unifiée de calcul hétérogène, le déploiement de modèles haute performance et l'ordonnancement par routage intelligent. Nous avons servi des centaines de clients entreprise dans les secteurs financier, manufacturier, médical et autres, fournissant des services d'infrastructure AI chaîne complète des ressources de calcul au déploiement d'applications.
Quelle est la différence entre les instances réservées et le paiement à l'usage ?
Les instances réservées sont des ressources de calcul dédiées non partagées avec d'autres, garantissant la précision du modèle et la stabilité d'inférence, adaptées aux charges de travail de production avec des exigences strictes de latence et de disponibilité. Le paiement à l'utilisation utilise des pools de ressources partagées facturés selon l'usage réel, adaptés au développement/test et aux scénarios métier élastiques. L'utilisation à long terme d'instances réservées est plus rentable.
Quelles puces nationales sont supportées ?
Supporte actuellement les architectures de puces nationales Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, ainsi que les GPU internationaux majeurs NVIDIA A100/H100. Grâce à la gestion unifiée de calcul hétérogène, les entreprises peuvent choisir flexiblement des solutions de puces, évitant le verrouillage fournisseur unique.
Comment la passerelle AI garantit-elle la sécurité des données ?
AI网关支持Déploiement privé,所有数据在企业内网流转,不经过公网。提供数据脱敏、访问控制、全链路加密传输、操作Journaux d'audit等企业级安全能力,满足金融、医疗等行业的合规要求。
MaaS平台支持Déploiement privé吗?
支持。MaaS平台提供公有云SaaS和Déploiement privé两种模式。Déploiement privé可将完整平台部署在企业数据中心,数据完全不出域,适合对数据安全有严格要求的行业客户。
Comment démarrer avec les services de KHB ?
Vous pouvez nous contacter via les coordonnées en bas de page. Notre équipe solutions fournira des propositions personnalisées basées sur vos besoins métier. De la discussion des besoins à la conception de solutions, au déploiement d'environnement et à la maintenance, nous fournissons un support professionnel tout au long du processus.
Pourquoi les entreprises ont-elles besoin d'une passerelle AI si elles ont déjà des API LLM ?
Lorsque les entreprises introduisent plusieurs LLM, des problèmes courants apparaissent rapidement : des sources de modèles diverses entraînent des protocoles API incohérents, les chaînes d'appel dispersées manquent de gestion unifiée, les différentes applications ont des exigences SLA variées difficiles à satisfaire globalement, et les volumes d'utilisation et les coûts sont difficiles à mesurer. La passerelle AI résout centralement ces problèmes, fournissant un accès unifié, un routage intelligent, une gouvernance fine et une observabilité chaîne complète.
La passerelle AI ajoute-t-elle une surcharge réseau ?
La passerelle AI utilise une architecture proxy haute performance, avec une latence supplémentaire généralement inférieure à 1-3ms, ce qui est négligeable par rapport à la latence d'inférence LLM elle-même (centaines de millisecondes à secondes). De plus, le routage intelligent et l'optimisation du pool de connexions de la passerelle peuvent réellement réduire la latence globale.
Comment contrôler les coûts d'utilisation LLM via la passerelle ?
La passerelle supporte la configuration de quotas de trafic et de politiques de limitation de débit par utilisateur, API Key, projet, organisation et autres dimensions, fournissant une transparence des coûts chaîne complète et une facturation précise, aidant les entreprises à surveiller en temps réel les coûts d'utilisation LLM et à éviter les dépassements budgétaires.
Quand une entreprise doit-elle déployer une plateforme MaaS privée ?
Les entreprises devraient y penser quand : 1) Le métier implique des données sensibles avec des exigences strictes de souveraineté des données ; 2) Besoin de déployer des capacités AI à grande échelle dans de nombreux scénarios avec des exigences extrêmement élevées de performance et de stabilité d'inférence ; 3) Environnements de calcul nationaux ou hétérogènes diversifiés nécessitant une gestion unifiée et une utilisation efficace ; 4) Souhait de suivre le développement technologique AI mais manque d'équipe d'ingénierie pour l'adaptation et l'optimisation continues des modèles.
Comment les services AI internationaux et nationaux de KHB sont-ils répartis et appliqués ?
I. Répartition des entités de service
KHB INC (Société américaine) : Fournit des services API de modèles AI étrangers de toutes catégories, exclusivement pour les entreprises et individus étrangers avec une identité étrangère. Exigences d'accès : certification de qualification complète, supporte carte de crédit USD, USD et règlement USDT. Ce service est limité aux scénarios étrangers et ne doit pas être improprement transféré en interne.
Hangzhou Kaihabesi Ecological Technology Co., Ltd. : Opère principalement les services API proxy LLM conformes nationaux, toutes les données traitées en interne, adhérant strictement à toutes les lois et réglementations nationales.

II. Déclaration de droits, responsabilités et conformité
Les deux entités opèrent indépendamment, chacune assumant la responsabilité légale de ses services respectifs, sans responsabilité solidaire.
Les activités liées aux services AI étrangers suivent les réglementations locales. Les utilisateurs sont strictement interdits d'utiliser les interfaces étrangères pour fournir des services en interne ou de transmettre improprement des données nationales. Les contrevenants en assument les conséquences.
Les services nationaux sont strictement interdits dans les scénarios illégaux ou non conformes. Les utilisateurs doivent respecter les exigences réglementaires nationales.
La plateforme se réserve le droit de vérifier les qualifications d'utilisation et peut suspendre ou résilier le service pour les comptes non conformes.

KHB INC
Hangzhou Kaihabesi Ecological Technology Co., Ltd.
Lancez votre infrastructure AI

Que vous exploriez l'IA pour la première fois ou que vous recherchiez des mises à niveau de calcul et de services de modèles, KHB propose des solutions professionnelles

Lancer LAUNCH
Demande commerciale : ai@khb.hk