Back to the image to 3D generator

Como funciona, na prática, a nossa fase de imagem para 3D Hunyuan3D

Esta não é uma página de comparação disfarçada de documentação: a nossa própria fase de reconstrução executa genuinamente um modelo de imagem para 3D Hunyuan3D — mais concretamente o tencent/hunyuan3d-2, um modelo disponibilizado publicamente. Acreditamos que vale a pena explicá-lo de forma clara em vez de nos escondermos atrás de linguagem de marketing, pelo que esta página descreve o que ele realmente faz bem, o que não tenta fazer e como se enquadra no pipeline de duas fases que está por trás de cada conversão em image-to-3d.pro. Para a fase anterior, que cria a imagem conceptual, veja como funciona toda a conversão.

Antes de começar: o que esta fase necessita

É a segunda de duas fases e espera um tipo específico de entrada.

Uma imagem de referência clara.

Esta fase de 3D reconstrói a partir de uma única imagem, não de vários ângulos fundidos.

Uma imagem conceptual já limpa.

Uma fase de IA separada gera ou refina essa imagem primeiro; esta fase trata apenas do passo de reconstrução.

Cerca de um minuto de tempo de execução.

A reconstrução é trabalho computacional real, não uma pré-visualização instantânea.

Expectativa de uma malha, e não de uma cena.

Reconstrói um único objeto por execução, não um ambiente com vários objetos.

À vontade com um modelo aberto.

A Tencent disponibilizou-o publicamente, pelo que o seu comportamento está documentado em vez de ser uma caixa negra.

Uma execução completa, do início ao fim

Um prompt ou uma fotografia carregada passa primeiro por um passo de imagem conceptual, que produz uma única imagem limpa e bem iluminada do sujeito. Essa imagem é depois entregue ao Hunyuan3D-2 para a fase de reconstrução 3D: infere o volume por trás da imagem plana, constrói uma forma fechada e aplica uma textura sobre a mesma. O que esta fase faz realmente bem é a reconstrução de um único objeto a partir de uma imagem — preservando uma silhueta reconhecível e o pormenor da superfície 3D sem necessitar de múltiplos ângulos de referência. O que não faz é fundir várias fotografias numa única forma 3D, criar rig ou animar o resultado, nem garantir uma contagem exata de triângulos; não publicamos números de benchmark que não possamos suportar, e esta página não faz afirmações sobre como funciona internamente o pipeline de qualquer outro fornecedor nomeado.

Definições de reconstrução nesta fase

O que é realmente configurável nesta fase do pipeline.

DefiniçãoPormenor
Sistema subjacentetencent/hunyuan3d-2, um modelo de reconstrução 3D disponibilizado publicamente
EntradaUma única imagem conceptual ou de referência
Pormenor da malhaDensidade de triângulos padrão ou alta
SaídaMalha 3D .glb com textura, transferível diretamente
Tempo de execução típicoCerca de um minuto só para esta fase

O que faz falhar uma execução de reconstrução

Na maioria dos casos, um desfasamento entre a imagem e o que esta fase espera.

Mais do que um sujeito no enquadramento.

Reconstrói um único objeto; vários sujeitos produzem uma forma 3D fundida e inutilizável.

Sem silhueta legível.

Recortes extremos ou oclusão intensa deixam a reconstrução sem informação de forma suficiente para inferir o volume.

Esperar rigging ou animação.

Esta fase produz uma malha 3D estática; posicioná-la é um passo separado e posterior.

Esperar números de benchmark exatos.

Descrevemos aquilo em que é bom em termos simples, em vez de citar números que não podemos verificar.

Executar muitas conversões consecutivas.

Aplica-se um limite de frequência real por sessão, tal como em todo o resto do site.

Questions

Frequently Asked Questions

O Hunyuan3D-2 é um modelo de reconstrução de imagem para 3D. Dada uma única imagem, infere o volume 3D por trás dela e produz uma malha com textura. É aquilo que a nossa fase de reconstrução executa.

Turn Your Image Into a 3D Model — Free

Sem cadastro, sem software e sem experiência em modelagem. Solte uma imagem ou descreva uma, e baixe um .glb com texturas em cerca de um minuto.