Documento prático de testes, prompts e integração do modelo de imagem para os totens nos aeroportos.
O fluxo funciona de ponta a ponta sem operador. O usuário tira a foto com roupas normais de viagem e recebe a imagem no celular ambientada no gramado da Cidade do Rock, com o Palco Mundo ao fundo e visual de show real.
A câmera vertical tira a foto da pessoa com roupas de viagem no saguão.
A IA recebe a foto da pessoa e o recorte do palco, gerando o festival em cerca de 30s.
O sistema aplica a moldura oficial e a máscara redonda no centro da imagem.
O usuário recebe a foto pronta com folga nas bordas para poder postar ou cortar como quiser.
Amostra selecionada a partir de mais de 50 variações e testes de estresse. (Clique na foto para ampliar).
Barba, armação dos óculos e sorriso mantidos; mãos anatômicas com gesto de rock; fundo trocado pelo gramado.
Roupas originais preservadas; sinais de paz mantidos com mãos limpas; sem misturar os traços dos dois rostos.
Isolamento da protagonista no saguão; blazer de tweed mantido; sorriso natural e dedos corretos.
Celular removido da orelha; mãos abaixadas e vazias; óculos e traços faciais preservados.
Copo descartável removido com mãos limpas; microexpressão de piscadela preservada com fidelidade.
Sorriso aberto e corte platinado mantidos; estampa da camiseta preservada; sinal de paz sem falhas.
Celular na mão removido; textura dos dreadlocks e calça xadrez preservados com precisão.
Garrafa d'água removida; os 4 rostos preservados sem misturar traços; roupas individuais mantidas.
Cachos volumosos e sorriso mantidos; postura corporal relaxada com mãos limpas no gramado.
Jaqueta de couro, colares e tatuagem no pulso mantidos; gesto de rock perfeito nos dedos.
Rosto natural preservado sem distorções; roupas trocadas por estilo casual de festival.
Coto natural mantido com manga fechada; zero criação de membros extras ou robóticos.
Muletas apoiadas no gramado; barra da calça dobrada respeitada; mochila removida.
Estrutura da cadeira integrada com sombras no chão; roupas trocadas por peças urbanas.
Manchas naturais de despigmentação mantidas sob o flash; figurino casual adicionado.
Véu religioso mantido 100% intocado; reestilização aplicada apenas nas peças do corpo.
Proporções corporais e feições maduras preservadas, sem infantilizar a pessoa.
Cabelos grisalhos e marcas de expressão mantidos sem rejuvenescimento; mala removida.
Malas deletadas; roupas formais substituídas por peças casuais; óculos preservados.
Mochila removida; camisas convertidas em casacos leves; risadas preservadas.
Mochila infantil removida; proporções de altura mantidas; sorrisos naturais nos 3 rostos.
Quem estava sério ficou de boca fechada; quem estava rindo manteve o riso; malas eliminadas.
Crachás de trabalho e malas de rodinha removidos; peças de roupas com cortes e cores variadas.
Camisa social e crachá trocados por jaqueta casual; expressão séria mantida sem forçar sorriso.
Smartphone mantido nas mãos; dedos e postura anatômica corretos sem fusão com o corpo.
Bolsa de ombro removida; casaco casual adicionado; sorriso aberto preservado.
Colar artesanal preservado; alças da mochila cargueira removidas; sorriso radiante mantido.
Bolsa transversal removida; sobreposição casual adicionada; lábios selados mantidos.
Três tipos de sorrisos preservados de forma independente; óculos mantidos; roupas variadas.
Avaliamos os principais motores de imagem diretamente contra o desafio do totem (reter o rosto da foto, ancorar o Palco Mundo e responder rápido):
Manteve a identidade da foto de entrada, gerou textura de pele real com luz de flash direto e segurou a posição do Palco Mundo oficial.
Qualidade visual muito alta, mas com acabamento de pele mais polido (com cara de filtro) e custo de processamento mais elevado.
Exigiram várias etapas manuais para encaixar o palco, aumentando o tempo para mais de 50 segundos e deixando emendas no cabelo.
Geração muito rápida, mas com alta taxa de deformação no rosto e tendência a criar pessoas estranhas no fundo da foto.
Abaixo estão os prompts testados para atender à variedade de roupas, trava de boca fechada e posicionamento natural do Palco Mundo:
Finalidade Prática:
Método oficial de produção. Disparo direto na API (~30s) combinando Foto do Usuário + Recorte do Palco. Aplica roupas variadas, névoa suspensa no ar, trava seca de boca fechada, horizonte reto e Palco Mundo deslocado para o lado.
Disparo único mantendo exatamente as roupas que a pessoa vestia na foto do totem, com horizonte reto, palco deslocado e trava de boca fechada.
Status Técnico:
Fluxo versionado para testes de bancada. Divide a geração em base de festival (Etapa 01) e transplante do rosto por recorte (Etapa 02). Tempo total de aproximadamente 60 segundos.
Etapa 01: Base do Festival
Etapa 02: Troca de Rosto (Inpainting)
Configuração reserva dando prioridade máxima aos traços faciais, com horizonte reto, palco deslocado e trava de boca fechada.
Mantém a foto reta para cortes em qualquer formato e joga o palco para o lado vazando da imagem, parecendo foto casual real.
Impede a IA de inventar dentes em quem estava sério; só desenha dentes em quem já sorria de verdade na foto original.
Mantém juntas todas as pessoas que estão posando na frente, apagando só transeuntes do saguão do aeroporto.
Curva as laterais e o chão com estilo autêntico de foto de festival, sem distorcer o rosto de quem está na frente.
Cria névoa no ar que reflete as luzes dos holofotes, trazendo profundidade visual e clima de show ao ar livre.
Gera sobreposições casuais de festival (jaquetas, camisas abertas e estampas) sem repetir a mesma roupa em todo mundo.
Clona as treliças e os telões diretamente do recorte oficial da Cidade do Rock, com alta estabilidade visual.
Remove copos descartáveis, garrafas e celulares da mão, limpando marcas comerciais não autorizadas.
Gera sombras duras no gramado e reflexo na pele para a pessoa não parecer uma colagem colada no Photoshop.
Histórico completo de problemas identificados durante os testes e as soluções aplicadas nos prompts:
O modelo tentava recriar o fundo quando o texto descrevia o festival de forma aberta.
A IA tentava criar dinamismo inclinando a foto, o que estragava os cortes verticais e quadrados.
Lentes grandes-angulares exigem espaço superior para curvar o chão de forma natural.
A IA forçava dentes visíveis em rostos sérios pelo contexto festivo do evento.
Flash frontal isolado sem luz de fundo fazia a pessoa parecer colada na imagem.
A IA apagava acompanhantes reais da foto ao tentar isolar um único sujeito.
A IA inventava copos de redes de fast-food e bebidas na mão do usuário.
Malas de viagem apareciam fundidas às pernas das pessoas no meio do festival.
O motor gerava braços ou pernas falsas ao receber comandos de poses.
A IA viciava em colocar a mesma roupa em todos os passageiros testados.
A IA tentava trocar hijabs ou quipás por bonés ou cabelos soltos.
Comandos restritivos demais deixavam a pele borrada e artificial.
Pessoas que passavam no fundo do saguão apareciam no meio da pista do festival.
A plateia ao fundo parecia uma imagem plana descolada do chão.
A fumaça cênica foi ajustada para ficar suspensa no ar capturando a luz dos holofotes, criando profundidade tridimensional e evitando névoa rasteira no chão.
Em fotos abertas, o rosto tem menos pixels, o que leva a IA a fundir dentes ("efeito chiclete") ou inventar sorrisos em bocas relaxadas.
Modelos generativos não são 100% determinísticos; assume-se sempre uma margem técnica de até 10% de variações ou alucinações possíveis em qualquer elemento da cena.
Análise prática de tempo e estabilidade para a operação real nos totens:
Foto do passageiro + recorte do palco entram juntos na API em disparo direto (~30s).
Gera a base de festival na Etapa 1 (~30s) e tenta trocar o rosto na Etapa 2 (~30s).
Direcionamento de Produção: Operar 100% no Disparo Único (v2.0) para garantir rapidez (~30s), visual integrado com a multidão e ausência de emendas no pescoço.