NeuroPipe gives you a single OpenAI-compatible endpoint for the best open-weight models. Stream tokens over HTTP/2 or gRPC, run bulk embedding jobs, and pay only for what you use.
Get startedView API referenceDrop-in replacement. Change the base URL and keep your existing SDKs, tools and prompts.
Server-sent events and bidirectional gRPC streams with sub-100 ms time-to-first-token.
Embeddings, re-ranking and offline batch jobs on dedicated high-bandwidth GPU pools.
No prompt logging, no training on your data. Regional routing and per-key quotas.
| Model | Context | Type | Latency (p50) |
|---|---|---|---|
| llama-3.3-70b-instruct | 128k | Chat | 78 ms |
| qwen2.5-72b-instruct | 128k | Chat | 84 ms |
| mistral-large-2 | 128k | Chat | 91 ms |
| deepseek-v3 | 64k | Chat / Code | 103 ms |
| bge-m3 | 8k | Embeddings | 12 ms |
| whisper-large-v3 | - | Speech-to-text | 240 ms |
$0 / month
1M tokens included, 10 req/s
$0.40 / 1M tokens
Priority routing, 200 req/s, SSE + gRPC
Custom
Reserved GPUs, 10 Gbit/s ingest, private regions
For long-lived sessions and bulk pipelines use our bidirectional gRPC endpoint. One connection, many concurrent streams.
# grpc endpoint host = neuro-api.animereze.site:443 service = neuropipe.serving.v2.Session metadata = authorization: Bearer <API_KEY>