lramosc1512's picture
Update README.md
2ec5e67 verified
|
Raw
History Blame Contribute Delete
3.74 kB
---
base_model: stable-diffusion-v1-5/stable-diffusion-v1-5
library_name: diffusers
license: creativeml-openrail-m
tags:
- text-to-image
- stable-diffusion
- lora
- diffusers-training
instance_prompt: 'estilo_brasilia,'
inference: true
---
# LoRA — Estilo Brasília (Config 1: rank 4)
Adaptação LoRA do [Stable Diffusion v1.5](https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-v1-5), especializando o modelo no estilo visual da **arquitetura modernista de Brasília** (Oscar Niemeyer / Lúcio Costa) — concreto aparente, curvas orgânicas, pilotis e o contraste com o céu do Cerrado.
Projeto acadêmico "Ateliê Generativo", disciplina de Modelos Multimodais (UniCEUB).
## Como usar
```python
from diffusers import StableDiffusionPipeline
import torch
pipe = StableDiffusionPipeline.from_pretrained(
"stable-diffusion-v1-5/stable-diffusion-v1-5",
torch_dtype=torch.float16,
).to("cuda")
pipe.load_lora_weights("lramosc1512/lora-estilo-brasilia-config1")
prompt = "estilo_brasilia, fachada curva de concreto branco refletida em espelho d'agua ao entardecer"
imagem = pipe(prompt, num_inference_steps=30, guidance_scale=7.5).images[0]
```
Sempre inicie o prompt com o token de estilo `estilo_brasilia,` para ativar o estilo aprendido.
## Dataset
50 imagens de arquitetura modernista de Brasília — Congresso Nacional, Catedral Metropolitana, Palácio do Planalto, Palácio do Itamaraty, Palácio da Justiça, Memorial JK, Teatro Nacional, Museu Nacional, Torre de TV Digital, Panteão da Pátria, STF, Esplanada dos Ministérios e Ponte JK, entre outros. Imagens obtidas do Wikimedia Commons sob licenças CC-BY e CC-BY-SA, com proveniência completa documentada. Legendas geradas com BLIP e revisadas manualmente uma a uma.
## Hiperparâmetros de treinamento
| Parâmetro | Valor |
|---|---|
| rank | 4 |
| learning_rate | 1e-4 |
| max_train_steps | 1000 |
| lr_scheduler | cosine |
| resolution | 512 |
| mixed_precision | fp16 |
| gradient_accumulation_steps | 4 |
Treinado com o script oficial `train_text_to_image_lora.py` da biblioteca `diffusers`, em GPU T4 (Google Colab). Checkpoints salvos a cada 250 passos, com backup direto no Google Drive durante o treino.
## Avaliação
- **CLIPScore médio:** 31.45 (modelo base sem LoRA: 30.43)
- **Achado qualitativo:** em comparação com a Config 2 (rank 8), esta configuração apresentou casos de mistura de identidades entre prédios distintos — por exemplo, elementos do Palácio do Planalto combinados com a fachada do Itamaraty em uma mesma estrutura fisicamente incoerente. Possível causa: capacidade insuficiente do rank baixo para separar ~15 conceitos visuais diferentes sob o mesmo token de estilo.
- **Verificação de memorização:** nenhuma reprodução próxima das imagens de treino foi identificada nos testes realizados (10 amostras comparadas).
## Limitações conhecidas
- Dataset pequeno (50 imagens): pode não generalizar bem para elementos arquitetônicos fora do conjunto de treino.
- O Panteão da Pátria, especificamente, foi mal representado nas gerações — possível sub-representação desse prédio no dataset.
- Rank baixo (4) mostrou maior tendência a misturar identidades entre prédios diferentes na mesma geração (ver Config 2 para uma alternativa com rank maior e melhor coerência estrutural).
- Não avaliado para geração de pessoas, interiores fora do dataset, ou estilos fora do escopo de arquitetura modernista.
## Usos pretendidos
Uso educacional/demonstrativo no contexto do projeto acadêmico Ateliê Generativo. Não recomendado para uso comercial ou para produção de conteúdo que possa ser confundido com fotografia real sem indicação de que se trata de imagem gerada por IA.