How to use from the
Use from the
Diffusers library
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained("stable-diffusion-v1-5/stable-diffusion-v1-5", torch_dtype=torch.bfloat16, device_map="cuda")
pipe.load_lora_weights("lramosc1512/lora-estilo-brasilia-config1")

prompt = "estilo_brasilia,"
image = pipe(prompt).images[0]

LoRA — Estilo Brasília (Config 1: rank 4)

Adaptação LoRA do Stable Diffusion v1.5, especializando o modelo no estilo visual da arquitetura modernista de Brasília (Oscar Niemeyer / Lúcio Costa) — concreto aparente, curvas orgânicas, pilotis e o contraste com o céu do Cerrado.

Projeto acadêmico "Ateliê Generativo", disciplina de Modelos Multimodais (UniCEUB).

Como usar

from diffusers import StableDiffusionPipeline
import torch

pipe = StableDiffusionPipeline.from_pretrained(
    "stable-diffusion-v1-5/stable-diffusion-v1-5",
    torch_dtype=torch.float16,
).to("cuda")
pipe.load_lora_weights("lramosc1512/lora-estilo-brasilia-config1")

prompt = "estilo_brasilia, fachada curva de concreto branco refletida em espelho d'agua ao entardecer"
imagem = pipe(prompt, num_inference_steps=30, guidance_scale=7.5).images[0]

Sempre inicie o prompt com o token de estilo estilo_brasilia, para ativar o estilo aprendido.

Dataset

50 imagens de arquitetura modernista de Brasília — Congresso Nacional, Catedral Metropolitana, Palácio do Planalto, Palácio do Itamaraty, Palácio da Justiça, Memorial JK, Teatro Nacional, Museu Nacional, Torre de TV Digital, Panteão da Pátria, STF, Esplanada dos Ministérios e Ponte JK, entre outros. Imagens obtidas do Wikimedia Commons sob licenças CC-BY e CC-BY-SA, com proveniência completa documentada. Legendas geradas com BLIP e revisadas manualmente uma a uma.

Hiperparâmetros de treinamento

Parâmetro Valor
rank 4
learning_rate 1e-4
max_train_steps 1000
lr_scheduler cosine
resolution 512
mixed_precision fp16
gradient_accumulation_steps 4

Treinado com o script oficial train_text_to_image_lora.py da biblioteca diffusers, em GPU T4 (Google Colab). Checkpoints salvos a cada 250 passos, com backup direto no Google Drive durante o treino.

Avaliação

  • CLIPScore médio: 31.45 (modelo base sem LoRA: 30.43)
  • Achado qualitativo: em comparação com a Config 2 (rank 8), esta configuração apresentou casos de mistura de identidades entre prédios distintos — por exemplo, elementos do Palácio do Planalto combinados com a fachada do Itamaraty em uma mesma estrutura fisicamente incoerente. Possível causa: capacidade insuficiente do rank baixo para separar ~15 conceitos visuais diferentes sob o mesmo token de estilo.
  • Verificação de memorização: nenhuma reprodução próxima das imagens de treino foi identificada nos testes realizados (10 amostras comparadas).

Limitações conhecidas

  • Dataset pequeno (50 imagens): pode não generalizar bem para elementos arquitetônicos fora do conjunto de treino.
  • O Panteão da Pátria, especificamente, foi mal representado nas gerações — possível sub-representação desse prédio no dataset.
  • Rank baixo (4) mostrou maior tendência a misturar identidades entre prédios diferentes na mesma geração (ver Config 2 para uma alternativa com rank maior e melhor coerência estrutural).
  • Não avaliado para geração de pessoas, interiores fora do dataset, ou estilos fora do escopo de arquitetura modernista.

Usos pretendidos

Uso educacional/demonstrativo no contexto do projeto acadêmico Ateliê Generativo. Não recomendado para uso comercial ou para produção de conteúdo que possa ser confundido com fotografia real sem indicação de que se trata de imagem gerada por IA.

Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for lramosc1512/lora-estilo-brasilia-config1

Adapter
(659)
this model