--- license: apache-2.0 pipeline_tag: text-to-speech tags: - model_hub_mixin - pytorch_model_hub_mixin language: - sw base_model: - sesame/csm-1b --- # Swa-CSM-1B **Swa-CSM-1B** is the best open-source Swahili text-to-speech model, fine-tuned from [Sesame's CSM-1B](https://huggingface.co/sesame/csm-1b) for high-quality Swahili speech generation. This model powers [Soga](https://nadhari.ai/soga), a Swahili AI voice assistant. Developed by [Nadhari AI Lab](https://nadhari.ai) . ## Model Details - **Base Model:** [sesame/csm-1b](https://huggingface.co/sesame/csm-1b) - **Language:** Swahili (sw) - **Task:** Text-to-Speech - **Architecture:** Llama backbone with Mimi audio decoder (RVQ codes) ## Usage ### Basic Generation ```python import torch from transformers import CsmForConditionalGeneration, AutoProcessor model_id = "Nadhari/swa-csm-1b" device = "cuda" if torch.cuda.is_available() else "cpu" processor = AutoProcessor.from_pretrained(model_id) model = CsmForConditionalGeneration.from_pretrained(model_id, device_map=device) # Generate Swahili speech text = "[0]Mambo vipi?." inputs = processor(text, add_special_tokens=True).to(device) audio = model.generate(**inputs, output_audio=True) processor.save_audio(audio, "swahili_output.wav") ``` ### With Conversation Context For best results, provide conversational context: ```python conversation = [ {"role": "0", "content": [{"type": "text", "text": "Habari yako?"}]}, ] inputs = processor.apply_chat_template( conversation, tokenize=True, return_dict=True, ).to(device) audio = model.generate(**inputs, output_audio=True) processor.save_audio(audio, "swahili_conversation.wav") ``` ## Intended Use This model is designed for: - Swahili text-to-speech applications - Research in African language speech synthesis. ## Limitations - Optimized for standard Swahili; performance may vary with regional dialects - Inherited limitations from base CSM-1B model - Best results achieved with conversational context ## Ethical Considerations This model should not be used for: - Impersonation or fraud - Generating misleading or deceptive content - Any illegal or harmful activities By using this model, you agree to use it responsibly and ethically. ## Citation ```bibtex @misc{swa-csm-1b, author = {Nadhari AI Lab}, title = {Swa-CSM-1B: Swahili Text-to-Speech Model}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/Nadhari/swa-csm-1b} } ``` ## Acknowledgments - [Sesame](https://www.sesame.com/) for the base CSM-1B model ## Contact - **Organization:** [Nadhari AI Lab](https://nadhari.ai) - **Author:** [Alfaxad](https://nadhari.ai) - **Email:** [research@nadhari.ai] ---