All models

Moonshot

Kimi K2.6: Fast

Kimi K2.6 on a dedicated SGLang route with isolated capacity for latency-sensitive agent workloads.

1T MoE (~32B active)Modified MIT
Context

256K

Standard tok/s

70

TTFT

280ms

Ultra-fast tier serves at 1,000+ tps on reserved capacity, see pricing.

Pricing

Input
$0.68 / 1M tokens
Output
$3.41 / 1M tokens
Cached input
$0.144 / 1M tokens
Fine-tunes
Same per-token price as base

Capabilities

  • SSE streaming
  • Tool / function calling
  • Structured JSON outputs
  • Reasoning traces

Use cases

Coding agentsLatency-sensitive tool useLong-horizon reasoning

Quickstart

Full quickstart
kimi-k2.6-fast.py
from openai import OpenAI client = OpenAI( base_url="https://api.cogito.decart.ai/v1", api_key=os.environ["COGITO_API_KEY"], ) response = client.chat.completions.create( model="moonshotai/kimi-k2.6:fast", messages=[{"role": "user", "content": "Hello!"}], ) print(response.choices[0].message.content)