Text Generation
Transformers
Safetensors
code
fela
fourier-neural-operator
fno
gated-deltanet
cpu
on-device
autocomplete
fill-in-the-middle
constant-memory
custom_code
Eval Results (legacy)
Instructions to use lowdown-labs/fela-autocomplete with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lowdown-labs/fela-autocomplete with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="lowdown-labs/fela-autocomplete", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("lowdown-labs/fela-autocomplete", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use lowdown-labs/fela-autocomplete with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "lowdown-labs/fela-autocomplete" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lowdown-labs/fela-autocomplete", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/lowdown-labs/fela-autocomplete
- SGLang
How to use lowdown-labs/fela-autocomplete with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "lowdown-labs/fela-autocomplete" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lowdown-labs/fela-autocomplete", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "lowdown-labs/fela-autocomplete" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lowdown-labs/fela-autocomplete", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use lowdown-labs/fela-autocomplete with Docker Model Runner:
docker model run hf.co/lowdown-labs/fela-autocomplete
| from transformers import PretrainedConfig | |
| class FelaConfig(PretrainedConfig): | |
| model_type = "fela" | |
| def __init__( | |
| self, | |
| vocab_size=151936, | |
| seq_len=2048, | |
| n_layer=28, | |
| n_embd=1536, | |
| n_head=12, | |
| ffn_hidden=8960, | |
| layer_pattern="SSSL", | |
| gla_delta=True, | |
| fno_modes=512, | |
| gla_chunk=256, | |
| landmark_layer_every=7, | |
| landmark_chunk=32, | |
| landmark_max=64, | |
| attn_layer_every=0, | |
| tie_word_embeddings=False, | |
| use_cache=False, | |
| **kwargs, | |
| ): | |
| self.vocab_size = vocab_size | |
| self.seq_len = seq_len | |
| self.n_layer = n_layer | |
| self.n_embd = n_embd | |
| self.n_head = n_head | |
| self.ffn_hidden = ffn_hidden | |
| self.layer_pattern = layer_pattern | |
| self.gla_delta = gla_delta | |
| self.fno_modes = fno_modes | |
| self.gla_chunk = gla_chunk | |
| self.landmark_layer_every = landmark_layer_every | |
| self.landmark_chunk = landmark_chunk | |
| self.landmark_max = landmark_max | |
| self.attn_layer_every = attn_layer_every | |
| self.num_hidden_layers = n_layer | |
| self.use_cache = use_cache | |
| super().__init__(tie_word_embeddings=tie_word_embeddings, **kwargs) | |