#!/usr/bin/env python3 """ Sixpert K2 - OpenAI-Compatible API Server ========================================== Runs Sixpert K2 as an OpenAI-compatible API server using llama-cpp-python. The MoE architecture means K2 activates only ~1.2B parameters per token, making it significantly faster than dense models of similar total parameter count. Usage: pip install llama-cpp-python python api_server.py Then use with any OpenAI-compatible client: curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "sixpert-k2", "messages": [{"role": "user", "content": "Explain quantum computing deeply"}] }' """ import argparse from llama_cpp.server.app import create_app from llama_cpp import Llama def main(): parser = argparse.ArgumentParser(description="Sixpert K2 API Server") parser.add_argument( "--model", type=str, default="SixpertK2.gguf", help="Path to GGUF model" ) parser.add_argument("--host", type=str, default="0.0.0.0", help="Server host") parser.add_argument("--port", type=int, default=8000, help="Server port") parser.add_argument("--gpu-layers", type=int, default=-1, help="GPU layers (-1 = all)") parser.add_argument("--threads", type=int, default=8, help="CPU threads") args = parser.parse_args() print("=" * 60) print(" Sixpert K2 API Server") print(" Deep Reasoning Engine (MoE)") print(" Total: ~8.9B params | Active: ~1.2B per token") print("=" * 60) llm = Llama( model_path=args.model, n_ctx=131072, n_gpu_layers=args.gpu_layers, n_threads=args.threads, verbose=False, ) app = create_app(llm) print(f"\n Server running at http://{args.host}:{args.port}") print(f" Model: sixpert-k2") print(f" Endpoint: POST /v1/chat/completions") print(f" Endpoint: POST /v1/completions") print("=" * 60) import uvicorn uvicorn.run(app, host=args.host, port=args.port) if __name__ == "__main__": main()