LoRA — Estilo Brasília (Config 2: rank 8)

Adaptação LoRA do Stable Diffusion v1.5, especializando o modelo no estilo visual da arquitetura modernista de Brasília (Oscar Niemeyer / Lúcio Costa) — concreto aparente, curvas orgânicas, pilotis e o contraste com o céu do Cerrado.

Projeto acadêmico "Ateliê Generativo", disciplina de Modelos Multimodais (UniCEUB). Esta é a configuração publicada na aplicação Gradio do projeto.

Como usar

from diffusers import StableDiffusionPipeline
import torch

pipe = StableDiffusionPipeline.from_pretrained(
    "stable-diffusion-v1-5/stable-diffusion-v1-5",
    torch_dtype=torch.float16,
).to("cuda")
pipe.load_lora_weights("lramosc1512/lora-estilo-brasilia-config2")

prompt = "estilo_brasilia, fachada curva de concreto branco refletida em espelho d'agua ao entardecer"
imagem = pipe(prompt, num_inference_steps=30, guidance_scale=7.5).images[0]

Sempre inicie o prompt com o token de estilo estilo_brasilia, para ativar o estilo aprendido.

Dataset

50 imagens de arquitetura modernista de Brasília — Congresso Nacional, Catedral Metropolitana, Palácio do Planalto, Palácio do Itamaraty, Palácio da Justiça, Memorial JK, Teatro Nacional, Museu Nacional, Torre de TV Digital, Panteão da Pátria, STF, Esplanada dos Ministérios e Ponte JK, entre outros. Imagens obtidas do Wikimedia Commons sob licenças CC-BY e CC-BY-SA, com proveniência completa documentada. Legendas geradas com BLIP e revisadas manualmente uma a uma.

Hiperparâmetros de treinamento

Parâmetro Valor
rank 8
learning_rate 5e-5
max_train_steps 1500
lr_scheduler cosine
resolution 512
mixed_precision fp16
gradient_accumulation_steps 4

Treinado com o script oficial train_text_to_image_lora.py da biblioteca diffusers, em GPU T4 (Google Colab). Checkpoints salvos a cada 250 passos, com backup direto no Google Drive durante o treino. Rank maior e learning rate mais conservador foram escolhidos para dar mais capacidade ao modelo sem comprometer a estabilidade do treino.

Avaliação

  • CLIPScore médio: 31.38 (modelo base sem LoRA: 30.43; Config 1: 31.45 — diferença entre as duas configurações dentro da margem de ruído esperada para apenas 6 prompts de teste).
  • Achado qualitativo: produziu estruturas visualmente mais coerentes que a Config 1, sem os casos de mistura de identidades entre prédios observados na configuração de rank menor. O CLIPScore não capturou essa diferença qualitativa — limitação conhecida da métrica, que mede alinhamento semântico geral, não fidelidade estilística fina.
  • Verificação de memorização: nenhuma reprodução próxima das imagens de treino foi identificada nos testes realizados (10 amostras comparadas).
  • Testes no pipeline multimodal completo (LLM → LoRA → TTS): temas com substantivos arquitetônicos concretos (ex.: "catedral", "casa de bairro nobre") produziram imagens fortemente alinhadas ao estilo treinado; temas abstratos ou não-arquitetônicos (ex.: "saudade") tenderam a gerar imagens com menor fidelidade ao estilo.

Limitações conhecidas

  • Dataset pequeno (50 imagens): pode não generalizar bem para elementos arquitetônicos fora do conjunto de treino.
  • O Panteão da Pátria, especificamente, foi mal representado nas gerações — possível sub-representação desse prédio no dataset.
  • Menor fidelidade ao estilo quando o prompt de entrada não contém vocabulário arquitetônico/concreto explícito.
  • Não avaliado para geração de pessoas, interiores fora do dataset, ou estilos fora do escopo de arquitetura modernista.

Usos pretendidos

Uso educacional/demonstrativo no contexto do projeto acadêmico Ateliê Generativo. Não recomendado para uso comercial ou para produção de conteúdo que possa ser confundido com fotografia real sem indicação de que se trata de imagem gerada por IA.

Downloads last month
20
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for lramosc1512/lora-estilo-brasilia-config2

Adapter
(659)
this model

Space using lramosc1512/lora-estilo-brasilia-config2 1