Conceito de Visão Computacional

A Visão Computacional é o campo interdisciplinar da Inteligência Artificial focado em ensinar computadores a processar, interpretar e extrair significado de informações visuais do mundo real (como imagens e vídeos). O objetivo final é emular e automatizar as tarefas complexas que o sistema visual humano realiza sem esforço.

O Gap Semântico

Para um ser humano, uma foto é instantaneamente reconhecida como um cachorro ou uma paisagem. Para um computador, essa mesma foto é apenas um emaranhado de valores numéricos de intensidade. O desafio central de toda a Visão Computacional moderna é superar esse gap semântico — a gigantesca lacuna entre os números matemáticos brutos lidos pelo hardware e o significado lógico abstraído por nós.

🧮 Fundamentação Matemática (Representação)

No universo algorítmico, uma imagem digital abandona seu status visual e se torna puramente matemática. Ela é tratada formalmente como um tensor multidimensional discreto.

IRH×W×CI \in \mathbb{R}^{H \times W \times C}

Eq. 1: Representação tensorial de uma imagem digital.

Onde:

  • II: o tensor ou estrutura de dados que representa a imagem completa.
  • HH: altura (Height) da grade da imagem em pixels.
  • WW: largura (Width) da grade da imagem em pixels.
  • CC: número de canais de espectro de cor (Channels). Em imagens monocromáticas (tons de cinza), C=1C=1. Em imagens coloridas convencionais (como RGB), C=3C=3.

Para acessar a informação de um ponto específico no espaço, usamos a notação de função avaliada I(x,y)I(x, y), que retorna o vetor de intensidade de cores (de dimensão CC) existente na coordenada espacial discreta (x,y)(x, y). Toda operação convolucional (como a da cnn) consiste em manipular matematicamente esses tensores.

A Hierarquia de Tarefas

O campo de Computer Vision (CV) resolve o problema dividindo-o em tarefas padronizadas, progressivamente mais granulares e desafiadoras:

  1. Classificação de Imagens (Image Classification): A fundação analítica. Responde à pergunta “O que é isso?”. O modelo recebe II e devolve um único rótulo (ex: “é um gato”).
  2. Detecção de Objetos (Object Detection): Além de dizer “o que”, diz “onde”. O algoritmo mapeia retângulos imaginários (bounding boxes) englobando múltiplos objetos simultaneamente na mesma foto. (Ex: faster-r-cnn, YOLO).
  3. Segmentação Semântica (Semantic Segmentation): Substitui as caixas genéricas por recortes contornados, classificando cada pixel individual da imagem em uma categoria de mundo (céu, asfalto, pessoa). No entanto, não distingue entidades individuais (duas pessoas juntas são vistas como um grande “bloco de pessoa”). (Ex: u-net).
  4. Segmentação de Instância (Instance Segmentation): O auge prático da compreensão visual. A rede recorta os pixels perfeitamente, e também diferencia os indivíduos (pintando a “pessoa 1” e a “pessoa 2” como entidades separadas e independentes). (Ex: mask-r-cnn).

Relacionadas: cnn

Construído com Eleventy · busca por Lunr.js