서비스 아키텍처 장점 활용 사례 소개 메인 사이트로 돌아가기 멤버 센터
GPU 클러스터 온라인
모델 준비 완료
API 가용성 99.99%

200+ 모델, 대규모 컴퓨트, 하나의 API로 모두 연결

DeepSeek·GLM·Qwen·Kimi·Llama 완전 통합, 엔터프라이즈급 AI 컴퓨트 플랫폼

모델 목록

사용 가능한 전체 모델 한눈에 보기

101+ 모델 사전 통합, 핵심 모델 아래에 목록, 지속 업데이트

모델 파라미터 컨텍스트 길이 정밀도 입력 가격(참고) 출력 가격(참고) 상태
GPT-4.1 mini OpenAI1M¥2.80 /百万Token¥11.20 /百万Token온라인
GPT-4.1 인기1M¥14.00 /百万Token¥56.00 /百万Token온라인
o3 추론200K¥14.00 /百万Token¥56.00 /百万Token온라인
Claude Sonnet 4.5 Anthropic200K¥21.00 /百万Token¥105.00 /百万Token온라인
Claude Haiku 3.5 Anthropic200K¥5.60 /百万Token¥28.00 /百万Token온라인
Gemini 2.5 Pro Google1M¥8.75 /百万Token¥70.00 /百万Token온라인
Gemini 2.5 Flash Google1M¥1.05 /百万Token¥4.20 /百万Token온라인
DeepSeek-V4 Pro 최신685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万Token온라인
DeepSeek-V4 Flash 최신685B MoE128KBF16¥0.50 /百万Token¥1.00 /百万Token온라인
DeepSeek-R1 추론685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万Token온라인
GLM-5 智谱200B+128KBF16¥1.00 /百万Token¥6.00 /百万Token온라인
GLM-5V-Turbo 多模态130B+128KBF16¥1.50 /百万Token¥3.00 /百万Token온라인
Qwen3.7 Max 최신397B MoE128KBF16¥2.00 /百万Token¥6.00 /百万Token온라인
Qwen3.6 Flash 고속235B MoE128KBF16¥0.30 /百万Token¥0.60 /百万Token온라인
Qwen3-Coder-Next 코드235B MoE128KBF16¥1.50 /百万Token¥3.50 /百万Token온라인
Kimi-K2.5 최신1T MoE256KBF16¥2.50 /百万Token¥5.00 /百万Token온라인
Kimi-K2 Thinking 추론1T MoE256KBF16¥3.00 /百万Token¥6.00 /百万Token온라인
MiniMax-M2.5 최신456B MoE1MBF16¥2.00 /百万Token¥4.00 /百万Token온라인
MiniMax-M2.5 Highspeed 고속456B MoE1MBF16¥1.00 /百万Token¥2.00 /百万Token온라인
Doubao Seed 2.0 Pro 豆包128KBF16¥1.50 /百万Token¥3.00 /百万Token온라인
Doubao Seed 2.0 Code Preview 코드128KBF16¥1.00 /百万Token¥2.00 /百万Token온라인
Llama-4 Meta400B MoE1MBF16¥2.50 /百万Token¥5.00 /百万Token온라인
Yi-Lightning 零一万物64KBF16¥0.50 /百万Token¥1.50 /百万Token온라인
Step-2 阶跃星辰128KBF16¥1.50 /百万Token¥3.20 /百万Token온라인
Hy3 Preview 混元128KBF16¥1.00 /百万Token¥2.00 /百万Token온라인
BAAI/bge-m3 Embedding568M8KFP16¥0.02 /百万Token온라인
활용 사례

원커맨드로 AI 배포

KHB AI 인프라 배포 솔루션을 산업별로 탐색, 개발자의 방식으로

enterprise-ai.sh
$ khb deploy --scenario=enterprise --model=DeepSeek-V3.2
算力资源分配完成
模型加载完成 DeepSeek-V3.2
API网关配置完成
企业AI平台已就绪
ENDPOINT: https://api.khb.com/v1/enterprise
STATUS: RUNNING
compute-center.sh
$ khb deploy --scenario=compute --chip=ascend,nvidia
异构算力统一纳管启动
NVIDIA A100 × 128 已接入
昇腾910B × 64 已接入
弹性调度引擎就绪
UTILIZATION: 94.7%
finance.sh
$ khb deploy --scenario=finance --security=private
프라이빗 배포环境初始化
数据隔离策略已启用
全链路加密传输已开启
감사 로그系统就绪
COMPLIANCE: PASSED
manufacturing.sh
$ khb deploy --scenario=manufacturing --instance=reserved
预留实例资源锁定
工业AI模型部署完成
7×24 SLA保障已启用
质检模型推理延迟 <50ms
UPTIME: 99.99%
예약 인스턴스

컴퓨트를 확보, 비즈니스를 보호

전용 예약 컴퓨트 · 모델 정밀도 보장 · 비용 통제 · 엔터프라이즈 SLA

DeepSeek-V3.2
deepseek-ai/DeepSeek-V3.2
가격 ¥594,000/组/月
실효 단가 ¥2.20/M tokens
TPM 1,250万
TTFT 1,600ms
TPS 45
컨텍스트 1M
엔터프라이즈급 복잡 추론 및 의사결정 분석, 코드 생성 및 소프트웨어 개발 지원, 에이전트 도구 호출에 적합
GLM-5
zai-org/GLM-5
가격 ¥594,000/组/月
실효 단가 ¥2.75/M tokens
TPM 1,000万
TTFT 1,500ms
TPS 30
컨텍스트 1M
엔터프라이즈급 에이전트 개발, 복잡 작업 계획 및 다단계 실행, 소프트웨어 엔지니어링 자동화에 적합
Kimi-K2.5
moonshotai/Kimi-K2.5
가격 ¥594,000/组/月
실효 단가 ¥6.88/M tokens
TPM 400万
TTFT 1,500ms
TPS 30
컨텍스트 256K
엔터프라이즈급 멀티모달 에이전트 개발, 시각 콘텐츠 이해 및 분석, 복잡 작업 자동화에 적합
MiniMax-M2.5
MiniMaxAI/MiniMax-M2.5
가격 ¥297,000/组/月
실효 단가 ¥2.75/M tokens
TPM 500万
TTFT 500ms
TPS 30
컨텍스트 1M
엔터프라이즈급 장문 문서 및 지식 베이스 분석, 지능형 고객 서비스 및 콘텐츠 생성, 비즈니스 프로세스 자동화에 적합
* TPM 기반 실효 단가, 월 30일·전체 이용률 50%로 계산. 성능 데이터는 일반적인 추론 파라미터 기준: 입력 24K Token, 출력 1K Token, 캐시 적중률 80%. (2026년 5월 20일 업데이트)
AI 게이트웨이

프라이빗 LLM 서비스 게이트웨이

통합 관리 · 지능형 라우팅 · 속도 제한 · 풀체인 관측 가능성

01 통합 멀티모델 접속
다양한 벤더 모델의 원스톱 접속 및 표준화 호출, OpenAI 호환 인터페이스 지원, 포인트 관리 제거, 멀티 벤더 에코시스템 간편 관리
02 지능형 라우팅 & 부하 분산
트래픽 특성과 LLM 서비스 특성을 결합한 지능형 동적 라우팅, 부하 분산, Fallback 페일오버, 서비스 안정성 및 비즈니스 SLA 보장
03 세밀한 거버넌스 & 속도 제한
사용자, API Key, 프로젝트, 조직 차원별 모델 권한·트래픽·할당량 관리 설정, 멀티테넌트 격리, 세밀한 모델 호출 거버넌스 실현
04 정확한 비용 계산
소비 사용자, API Key, 프로젝트, 조직, 모델, 컴퓨트에 걸친 풀체인 비용 투명성, 정확한 비용 계산 및 예산 통제 실현
05 풀체인 모델 관측 가능성
모델 호출량·성능 등 다차원 관측 가능성, 정밀 모델 거버넌스, 라이프사이클 관리 및 라우팅 전략 조정 지원, A/B 테스트 및 카나리 배포 지원
06 엔터프라이즈 데이터 보안
양방향 디센시타이제이션 실시간 프라이버시 위험 필터링, 연동 민감 콘텐츠 차단 및 감사 로그, 모든 LLM 비즈니스 트랜잭션의 컴플라이언스 및 추적 가능성 보장
보안 & 컴플라이언스

엔드투엔드 심층 방어 시스템

지능 기반 보안, 데이터부터 애플리케이션까지 풀체인 보호

🔐
엔드투엔드 암호화
풀체인 TLS 암호화 전송, 데이터 저장 암호화, 키 관리 시스템, 전송 중 및 저장 중 데이터의 절대적 보안 보장
🛡️
양방향 디센시타이제이션
입출력 양방향 실시간 디센시타이제이션 필터링, 민감 정보 자동 식별 및 마스킹, 프라이버시 데이터 유출 방지
📋
감사 로그
풀체인 운영 감사, 모든 API 호출 추적 및 감사 가능, 금융·의료 등 산업의 컴플라이언스 요구 충족
🏢
멀티테넌트 격리
테넌트 간 엄격한 데이터 격리, 세밀한 권한 제어, 조직·프로젝트·사용자별 다차원 접근 제어 지원
🔒
프라이빗 배포
데이터가 도메인을 벗어나지 않음, 모든 추론이 기업 인트라넷 내에서 완료, 가장 엄격한 데이터 주권 및 컴플라이언스 요구 충족
🚨
콘텐츠 보안 탐지
实时防御潜在攻击,콘텐츠 보안 탐지准确率超99%,敏感内容自动拦截,保障输出合规
파트너십

유연한 협력 모델

컴퓨트를 보유하고 있거나 컴퓨트가 필요한 경우, KHB가 적합한 파트너십 솔루션을 제공

🤝 공동 운영
컴퓨트 리소스를 보유하고 있으며 Token 서비스 역량을 빠르게 확보하고 KHB와 함께 엔드 고객에게 서비스하려는 분에게 적합
대표 파트너
IDC 사업자, 지역 지능 컴퓨팅 센터, GPU 클라우드 서비스 제공자, 국산 칩 제조사
가치 혜택
✓ 완전한 Token 생산 역량, 자체 기술 팀 구축 불필요
✓ 동등 컴퓨트에서 추론 처리량 대폭 향상
✓ 실제 서비스량 기반 수익 분배
✓ KHB 브랜드 보증 및 시장 지원
⚡ 컴퓨트 흡수 / Compute-as-a-Service
자체 구축 GPU 클러스터를 보유하고 있으며 추론 효율 향상, 운영 유지비 절감 또는 잉여 리소스를 Token 서비스 수익으로 전환하려는 분에게 적합
대표 파트너
자체 구축 컴퓨트를 보유한 정부/기업 고객, 대형 인터넷 기업, 금융 기관, 통신 사업자
가치 혜택
✓ 추론 효율 대폭 향상, 동등 컴퓨트로 더 큰 비즈니스 규모 지원
✓ GPU 성능 완전 활용, 적응 과제 해결
✓ 데이터는 자체 환경에서 실행, 보안 컴플라이언스 요구 충족
✓ 잉여 컴퓨트로 외부에 Token 서비스 제공, 추가 수익 창출
기술 아키텍처

컴퓨트부터 애플리케이션까지 데이터 흐름 아키텍처

4계층 아키텍처, 데이터는 좌에서 우로 흐르고, 계층별 협력으로 엔터프라이즈 AI 인프라 폐루프 구축

Layer 01
컴퓨트 리소스 계층
NVIDIA A100/H100
Huawei Ascend 910B
Muxi GPU
Moore Threads GPU
Layer 02
추론 서비스 계층
모델 로드 & 스케줄링
KV Cache 최적화
Continuous Batching
양자화 & 가속
Layer 03
API 게이트웨이 계층
OpenAI 호환 인터페이스
지능형 라우팅 게이트웨이
속도 제한 및 서킷 브레이킹
Token 계량 및 과금
Layer 04
애플리케이션 계층
지능형 고객 서비스
콘텐츠 생성
데이터 분석
산업 솔루션
0
사전 통합 모델 수
0
칩 아키텍처 지원
0
추론 지연 감소 %
0
처리량 향상 x
핵심 서비스

KHB·AI 코어를 둘러싼 서비스 매트릭스

4개 서비스가 코어를 궤도하며, 기반 컴퓨트부터 상위 게이트웨이까지 엔터프라이즈 AI 인프라 니즈를 풀체인 커버

KHB·AI
INFRASTRUCTURE
컴퓨트 운영
Token Factory
GPU 컴퓨트 운영, GPU 리소스를 효율적으로 Token 생산력으로 변환. NVIDIA 및 국산 칩 지원, 다중 아키텍처 컴퓨트 통합 접속 및 탄성 스케줄링 실현
🔒
예약 인스턴스
Reserved Instances
전용 예약 컴퓨트, 전용 리소스로 안정적인 비즈니스 운영 보장, 모델 정밀도 보장, 비용 통제 가능, 엔터프라이즈 SLA 약정
🏗️
MaaS 플랫폼
Enterprise MaaS
원스톱 AI 솔루션 플랫폼, 이종 컴퓨트 관리, 모델 훈련, 추론 배포 풀프로세스 커버, 100+ 모델 사전 통합, 바로 사용 가능
🌐
AI 게이트웨이
AI Gateway
프라이빗 LLM 서비스 게이트웨이, 통합 멀티모델 접속 관리, 지능형 라우팅 및 속도 제한, 풀체인 관측 가능성, 엔터프라이즈 데이터 보안 확보
컴퓨트 운영
TOKEN FACTORY
GPU算力运营,将GPU资源高效转化为Token生产力。支持NVIDIA及国产芯片(昇腾、沐曦、摩尔线程),实现多架构算力统一接入与弹性调度
🔒
예약 인스턴스
RESERVED INSTANCES
专属预留算力,独占式资源保障业务稳定运行。模型精度有保障,成本可控,企业级SLA承诺
🏗️
MaaS 플랫폼
ENTERPRISE MAAS
원스톱 AI 솔루션 플랫폼, 이종 컴퓨트 관리, 모델 훈련, 추론 배포 풀프로세스 커버, 100+ 모델 사전 통합, 바로 사용 가능
🌐
AI 게이트웨이
AI GATEWAY
프라이빗 LLM 서비스 게이트웨이, 통합 멀티모델 접속 관리, 지능형 라우팅 및 속도 제한, 풀체인 관측 가능성, 엔터프라이즈 데이터 보안 확보
장점

KHB를 선택하는 이유

숫자는 거짓말하지 않습니다, 모든 지표가 실력의 증명

0
사전 통합 모델 수
DeepSeek, GLM, Qwen, Kimi, GPT-4.1, Claude, Gemini 등 글로벌 주류 LLM 원클릭 접속, 동적 모델 미러 업데이트, 신규 모델 즉시 적응, API 즉시 호출 가능
0
추론 지연 감소
自研推理加速引擎,KV Cache深度优化与Continuous Batching,首Token延迟降低70%,无损精度动态量化,推理计算量减少60-80%
0
처리량 향상
异构算力弹性调度,单卡Token产出深度优化,同等算力下처리량 향상3至5倍,GPU集群利用率提升300%
0
칩 아키텍처 지원
NVIDIA A100/H100, Huawei Ascend 910B, Muxi GPU, Moore Threads GPU 동시 지원, 다중 아키텍처 통합 관리 및 지능형 스케줄링, 단일 벤더 락인 회피
0
서비스 가용성 SLA
엔터프라이즈 SLA 99.9% 가용성 약정, 다중 AZ 배포, 자동 페일오버 및 Fallback 저하, 7x24 기술 지원으로 비즈니스 연속성 보장
0
콘텐츠 보안 탐지
양방향 디센시타이제이션实时过滤隐私风险,콘텐츠 보안 탐지准确率超99%,联动敏感内容拦截与감사 로그,数据泄露风险降低99%
0
빠른 시작
可视化配置界面,3分钟内完成操作,30+开箱即用预置模板,OpenAI 호환 인터페이스,无需深厚技术背景即可跨场景调用
0
예약 인스턴스 납기
표준 예약 인스턴스 1-7 영업일 내 배포, 플랫폼이 모델 배포 및 성능 검증 처리, 추론 성능 튜닝 지원, 안정적인 비즈니스 온보딩 보장
자주 묻는 질문

자주 묻는 질문

KHB의 AI 인프라 기술 역량은 어느 정도인가요?
KHB는 자체 개발한 AI 컴퓨트 운영 및 추론 가속 엔진을 보유하고 있으며, 이종 컴퓨트 통합 관리, 고성능 모델 배포, 지능형 라우팅 스케줄링 등 핵심 기술 역량을 갖추고 있습니다. 금융, 제조, 의료 등 수백 개의 엔터프라이즈 고객에게 서비스를 제공하며, 컴퓨트 리소스부터 애플리케이션 배포까지 풀체인 AI 인프라 서비스를 제공합니다.
예약 인스턴스와 종량제의 차이는 무엇인가요?
예약 인스턴스는 타인과 공유하지 않는 전용 컴퓨트 리소스로, 모델 정밀도와 추론 안정성을 보장하며, 지연 및 가용성 요구사항이 엄격한 프로덕션 워크로드에 적합합니다. 종량제는 실제 사용량 기준 과금되는 공유 리소스 풀을 사용하며, 개발/테스트 및 탄력적 비즈니스 시나리오에 적합합니다. 장기 안정적 사용 시 예약 인스턴스가 더 비용 효율적입니다.
어떤 국산 칩을 지원하나요?
현재 Huawei Ascend 910B, Muxi GPU, Moore Threads GPU 등 국산 칩 아키텍처와 NVIDIA A100/H100 등 국제 주류 GPU를 지원합니다. 이종 컴퓨트 통합 관리를 통해 기업은 유연하게 칩 솔루션을 선택할 수 있어 단일 벤더 락인을 회피할 수 있습니다.
AI 게이트웨이는 데이터 보안을 어떻게 보장하나요?
AI网关支持프라이빗 배포,所有数据在企业内网流转,不经过公网。提供数据脱敏、访问控制、全链路加密传输、操作감사 로그等企业级安全能力,满足金融、医疗等行业的合规要求。
MaaS平台支持프라이빗 배포吗?
支持。MaaS平台提供公有云SaaS和프라이빗 배포两种模式。프라이빗 배포可将完整平台部署在企业数据中心,数据完全不出域,适合对数据安全有严格要求的行业客户。
KHB의 서비스를 어떻게 시작하나요?
페이지 하단의 연락처 정보를 통해 문의하실 수 있습니다. 솔루션 팀이 비즈니스 요구에 맞춘 맞춤 제안을 제공합니다. 요구사항 논의, 솔루션 설계, 환경 배포부터 운영 유지보수까지 전 과정에서 전문적인 지원을 제공합니다.
이미 LLM API가 있는데 왜 엔터프라이즈에 AI 게이트웨이가 필요한가요?
기업이 여러 LLM을 도입하면서 일반적인 문제가 빠르게 나타납니다: 다양한 모델 소스로 인한 API 프로토콜 불일치, 분산된 호출 체인의 통합 관리 부재, 다양한 애플리케이션의 상이한 SLA 요구사항에 대한 전체적 대응 어려움, 사용량 및 비용 파악 곤란. AI 게이트웨이는 이러한 문제를 중앙에서 해결하여 통합 접속, 지능형 라우팅, 세밀한 거버넌스 및 풀체인 관측 가능성을 제공합니다.
AI 게이트웨이가 네트워크 오버헤드를 추가하나요?
AI 게이트웨이는 고성능 프록시 아키텍처를 사용하며, 추가 지연은 일반적으로 1-3ms 이내로 LLM 추론 지연 자체(수백 밀리초~수초)와 비교하여 무시할 수 있습니다. 동시에 게이트웨이의 지능형 라우팅 및 커넥션 풀 최적화로 전체 지연을 실제로 감소시킬 수 있습니다.
게이트웨이를 통해 LLM 사용 비용을 어떻게 관리하나요?
게이트웨이는 사용자, API Key, 프로젝트, 조직 등 차원별로 트래픽 할당량 및 속도 제한 정책 설정을 지원하며, 풀체인 비용 투명성과 정확한 과금을 제공하여 기업이 LLM 사용 비용을 실시간 모니터링하고 예산 초과를 방지할 수 있도록 돕습니다.
엔터프라이즈는 언제 프라이빗 MaaS 플랫폼을 배포해야 하나요?
다음의 경우를 고려하세요: 1) 비즈니스에 민감 데이터가 포함되어 데이터 주권 요구사항이 엄격함; 2) 수많은 시나리오에서 AI 기능을 대규모 배포해야 하며 추론 성능 및 안정성 요구사항이 극히 높음; 3) 다양한 국산 또는 이종 컴퓨트 환경에서 통합 관리 및 효율적 활용이 필요함; 4) AI 기술 발전을 따라가고 싶지만 지속적인 모델 적응 및 최적화를 위한 엔지니어링 팀이 부족함.
KHB의 국제 AI 서비스와 국내 AI 서비스는 어떻게 구분되고 적용되나요?
1. 서비스 주체 구분
KHB INC(미국 법인): 전체 카테고리 해외 AI 모델 API 서비스 제공, 해외 신원을 가진 해외 기업 및 개인 전용. 접속 요구: 자격 인증 완료, USD 신용카드, USD 및 USDT 결제 지원. 본 서비스는 해외 시나리오로 제한되며 국내로 부적절 전용이 금지됨.
항저우 카이하베시 생태과기유한공사: 주로 국내 컴플라이언스 LLM 프록시 API 서비스를 운영, 모든 데이터는 국내에서 처리, 국내 모든 법률 규정을 엄격히 준수.

2. 권리·의무·컴플라이언스 선언
두 주체는 독립적으로 운영되며, 각각의 서비스에 대해 법적 책임을 부담하고 연대 책임은 없습니다.
해외 AI 서비스 관련 활동은 현지 규정을 따릅니다. 사용자는 해외 인터페이스를 사용하여 국내에서 서비스를 제공하거나 국내 데이터를 부적절하게 전송하는 것이 엄격히 금지됩니다. 위반 시 본인 책임.
국내 서비스는 불법·비컴플라이언스 시나리오에서의 사용이 엄격히 금지됩니다. 사용자는 국가 규제 요구사항을 준수해야 합니다.
플랫폼은 사용 자격을 확인할 권리를 보유하며, 비컴플라이언스 계정의 서비스를 일시 중지 또는 종료할 수 있습니다.

KHB INC
항저우 카이하베시 생태과기유한공사
AI 인프라를 시작하세요

처음 AI를 탐색하시거나 컴퓨트와 모델 서비스 업그레이드를 찾으시든, KHB가 전문적인 솔루션을 제공합니다

시작하기 LAUNCH
비즈니스 문의: ai@khb.hk