Ir para conteúdo principal

Space Intelligence - Como fazemos mapas

Metodologia da Space Intelligence para os mapas de desmatamento do ICE CoT EUDR.

C
Escrito por Caio Diniz

Mapas de desmatamento produzidos para uso na plataforma ICE CoT.

Os Mapas de desmatamento do ICE CoT EUDR estão disponíveis sob licença do ICE

Benchmark Administration Limited.

Sobre a Space Intelligence

Space Intelligence Ltd é uma empresa sediada no Reino Unido fundada em 2018.

A empresa foi fundada pelo Dr. Murray Collins e pelo Prof. Edward Mitchard, que na época eram empregados como acadêmicos pela Universidade de Edimburgo. Eles são especialistas mundiais no uso de dados de satélite para mapear a cobertura tropical e o armazenamento de carbono, e já publicaram mais de 100 artigos revisados por pares entre eles.

A Space Intelligence reuniu uma equipe de cientistas, ecologistas, engenheiros de software e especialistas em IA. No total, eles têm 56 funcionários, incluindo 13 com doutorado. Essa equipe é singularmente capaz de produzir dados de mapeamento de alta qualidade usando sua expertise ambiental para processar petabytes de dados de satélite de forma inteligente.

Eles fornecem dados para empresas e governos em todo o mundo, produzindo mapas para monitoramento de projetos de Soluções Baseadas na Natureza, com clientes como Apple, Shell e Equinor, além de muitos desenvolvedores de carbono florestal.

Mapas de habitat da Space Intelligence

A Space Intelligence cria mapas de cobertura do solo com resolução de 10 m para ajudar comerciantes e operadores de commodities em suas obrigações de conformidade com o EUDR.

Os mapas que produzimos estabelecem a linha de base de onde a terra era e onde não era floresta em 31 de dezembro de 2020, e onde ocorreu desmatamento e novas florestas cresceram desde então até os dias atuais.

Esses mapas seguem a definição de floresta do EUDR:

'Floresta' significa terras com mais de 0,5 hectare com árvores acima de 5 metros e cobertura do dossel superior a 10%, ou árvores capazes de atingir esses limiares in situ, excluindo terras predominantemente de uso agrícola ou urbano.

E a definição de desmatamento do EUDR, definida como:

'Desmatamento' significa a conversão da floresta para uso agrícola, seja

induzido por humanos ou não [após a data limite de 31 de dezembro de 2020].

Seguir essas definições envolve o difícil processo de determinar exatamente onde havia agricultura em 2020 e nos dias atuais, mesmo que essa agricultura frequentemente esteja localizada sob cobertura arbórea ou seja ela própria árvore (por exemplo, em sistemas agroflorestais como cacau ou café). Na verdade, áreas de árvores podem não se encaixar na definição de floresta por vários motivos:

  • Porque a área não possui 10% de cobertura de dossel

  • Porque a área de árvores é menor que 0,5 hectare

  • Porque a área não possui árvores capazes de atingir 5 m de altura naquela área

  • Como a terra atualmente é usada para agricultura, seja com culturas cultivadas no solo sob as árvores, seja porque algumas das árvores são culturas arbóreas (por exemplo, cacau ou árvores frutíferas).

Entradas para os mapas

Usamos os seguintes conjuntos de dados de satélite, tirando imagens ao longo do ano para coletar informações sobre como cada pedaço de terra muda em diferentes estações. Para levar em conta diferentes resoluções iniciais e projeções de mapas, todos os conjuntos de dados são alinhados e corrigidos pelo terreno na mesma grade de pixel de 10 m x 10 m. Essa grade está em uma projeção de área igual (ESPG: 6933) para garantir que cada pixel tenha o mesmo tamanho.

  • Dados ópticos. Como uma câmera com um telescópio em um satélite. Múltiplas bandas ao longo do espectro eletromagnético ajudam a diferenciar diferentes tipos de superfícies vegetadas ou não. Os dados coletados ao longo do ano podem ser usados para diferenciar tipos de vegetação estudando como o padrão de refletância muda ao longo das estações. Usamos dois satélites:

    • Sentinel-1. Satélites de radar na banda C (6 cm de comprimento de onda) com resolução de 10 m, operados pela ESA/UE. Dois ou mais satélites em órbita, dados normalmente a cada 12 dias em todos os trópicos.

    • ALOS-2 PALSAR-2. Satélite radar na banda L (comprimento de onda de 23 cm), resolução de 10 m a 100 m, operado pela JAXA. Dados menos frequentes que o Sentinel-1 (tipicamente a cada 42 dias), mas o comprimento de onda maior permite maior penetração na copa da floresta.

  • Dados LiDAR. Feixes de laser enviados diretamente de um satélite. Fornece informações sobre altura das árvores e cobertura do dossel, úteis para determinar pontos que atendem ou não à definição florestal da EUDR.

    • GEDI. Círculos de 25 m, um sensor na Estação Espacial Internacional. Operado pela NASA.

  • Informações sobre elevação, inclinação e orientação. Útil por si só (por exemplo, alguns tipos de vegetação não crescem acima/abaixo de certos níveis de elevação) e ajuda os algoritmos de aprendizado de máquina que usamos a corrigir certos efeitos sobre os dados não relacionados à cobertura do solo (por exemplo, o brilho pode ser maior em encostas voltadas para o satélite do que em aquelas voltadas para o exterior).

Elaboração dos mapas

Pontos de verdade e polígonos

Usamos quaisquer dados de campo que temos dos países a serem mapeados, especialmente excursões que fazemos, fotos abertas geograficamente, conjuntos de dados de mapeamento existentes e nossos especialistas analisando dados de satélite de altíssima resolução (<1 m), para criar um conjunto de polígonos nos quais estamos muito confiantes serem classes específicas de cobertura do solo.

Isso inclui fazer muito esforço para criar polígonos que sejam florestas plantadas, culturas arbóreas e agricultura sob árvores, assim como florestas abertas e fechadas. Esses polígonos são críticos para separar essas classes, que frequentemente se parecem superficialmente com dados de satélite.

Também criamos um conjunto de dados de teste independente de pontos, não usado para criar os mapas, mas para determinar quando eles são suficientemente precisos para uso.

Preparação de dados e aprendizado de máquina

Os conjuntos de dados de satélite são combinados em cubos de dados que cobrem um período de seis meses. Esse período abrange os últimos seis meses de 2020 (para produzir mapas mostrando a situação até 31 de dezembro de 2020) e os seis meses mais recentes (para cobrir o período até o presente). O período mais recente será atualizado anualmente, utilizando dados até 30 de setembro daquele

ano civil.

Nuvens e sombras de nuvens são removidas dos dados ópticos de satélite, e todos os conjuntos de dados são corrigidos e alinhados radiometricamente e de terreno.

Nossos cientistas de dados então treinam e executam um algoritmo de aprendizado de máquina combinando os polígonos de verdade e o cubo de dados de satélite, para prever mapas para o final de 2020 e o período mais recente. Esses são testados em relação ao conjunto de dados de teste independente. Com base nos resultados e na inspeção visual do mapa feita por nossos especialistas, aprimoramos o mapa executando-o novamente e fazendo alterações nos polígonos de referência, nos conjuntos de dados de satélite utilizados ou nos parâmetros do algoritmo de aprendizado de máquina, até obtermos um mapa final para um país que atenda aos nossos requisitos de precisão.

Pós-processamento

Os mapas de resolução de 10 m são pós-processados para fazer as seguintes alterações:

  • Reprojeção para a projeção geográfica de latitude/longitude (EPSG:4326) com tamanho de pixel de 10 m × 10 m no centro do país.

  • Remover áreas de 'floresta' compostas por menos de 50 pixels conectados, usando a regra do Caso de Rook, para consistência com o requisito EUDR de um tamanho mínimo de 0,5 ha de área de floresta. O Caso de Rook foi escolhido para evitar que pequenos trechos de floresta conectados por um canto de um pixel de 10 m fossem combinados para contar como meio hectare, já que nossa investigação descobriu que tais manchas normalmente não estavam conectadas ao solo.

  • Converter os mapas para mapas apenas de floresta/não-floresta, codificando pixels de 'borda', 'quase' e 'núcleo' de forma diferente (usando neste caso o Caso de Queen). Para o período mais recente, novos trechos de floresta são codificados de forma diferente e serão monitorados para perdas futuras.

  • Mapeando pixels que foram desmatados segundo as definições do EUDR e codificando-os como 'borda', 'borda-próxima' e 'núcleo' com base em sua posição quando eram florestas.

Processo de avaliação da precisão

É importante entender o desempenho ('precisão') dos produtos de cobertura do solo para saber se os mapas são adequados para um determinado caso de uso.

Levamos isso muito a sério na Space Intelligence e avaliamos a precisão dos nossos produtos e sua incerteza de forma estatisticamente rigorosa, seguindo boas práticas conforme descrito na literatura científica (1) e nos padrões internacionais (2, 3). Estabelecemos metas de desempenho com base nos requisitos de um contrato específico.

Resumo

A precisão é nuançada, e somos especialistas nessa nuance.

Acreditamos que um único número não é uma avaliação precisa da precisão, e uma análise mais detalhada é a única forma de realmente avaliar essa métrica.

Garantimos que nossos mapas atendam às necessidades e expectativas de nossos parceiros, e que fornecemos informações completas sobre seu desempenho e a taxa esperada de erros e incertezas inevitáveis.

Visão geral das abordagens para avaliação de precisão

A precisão pode ser testada de várias maneiras, mas a única abordagem que fornece uma avaliação significativa da precisão de um pixel aleatório no mapa de saída é a abordagem 4. Essa é a abordagem usada pela Verra na nova Metodologia Consolidada REDD+ (VM0048) e recomendada pelas diretrizes de boas práticas (1-3), mas nem sempre é seguida por empresas interessadas em exibir estatísticas de alta precisão.

  1. Uma comparação dos dados de treinamento de entrada (normalmente polígonos desenhados a olho com classes como 'floresta' ou 'não-floresta') em comparação com o mapa de saída.

  2. Uma comparação semelhante do mapa de saída com polígonos, mas usando

    polígonos produzidos de forma independente que não foram usados para treinar o mapa. Normalmente, a unidade usada é a proporção de pixels corretamente classificados ('precisão geral'), sendo os pixels individuais a unidade de avaliação, não os polígonos inteiros.

  3. Utilizando dados coletados in situ (dados de campo).

  4. A avaliação independente de um conjunto de pontos isolados, colocados sobre todo o mapa de saída usando uma abordagem amostral estatisticamente válida (geralmente uma grade ou uma amostra aleatória estratificada).

Referências:

1Olofsson, P., et al. 2014. Good practices for estimating area and assessing accuracy of land change. Remote Sensing of Environment.

2The International Panel on Climate Change (IPCC). 2003. Good Practice Guidance for Land Use, Land-use Change and Forestry.

3GFOI. 2020. Methods and Guidance from the Global Forest Observations Initiative (MGD). Edition 3.0.

Por que um único número não conta toda a história

É importante afirmar que usar uma única métrica (como a precisão geral) não é uma forma confiável de descrever a precisão do mapa.

Uma forma muito mais interpretável e transparente é usar uma matriz de erro que mostre as precisões de comissão e omissão para cada classe (essencialmente avaliando se o mapa está superestimando ou subestimando certas classes). Por exemplo, em uma área com taxa de desmatamento de 1%, não reportar desmatamento daria uma precisão geral de 99%, mesmo sem ser adequada para o propósito. É melhor informar nesse caso que o mapa tem 100% de precisão para florestas inalteradas e 0% para desmatamento: portanto, é claramente inadequado.


Qual é a nossa precisão no contexto do EUDR?

Para o EUDR, o foco está em separar a floresta natural de todos os outros tipos de cobertura do solo (que devem incluir classes com árvores, como o cacau). Isso permite avaliar a provável precisão de uma avaliação de que um determinado polígono, digamos, em 2020, era naquele momento floresta natural, ou já não era florestal.

Na Space Intelligence, acreditamos que a avaliação independente de pontos isolados seguindo as melhores práticas é a melhor forma de avaliar a precisão dos mapas florestais/não florestais (abordagem 4 já mencionada). Isso é feito por nossos ecologistas e cientistas de dados altamente qualificados, avaliando centenas de pontos 'às cegas', seguindo um esquema de amostragem estatisticamente válido, usando imagens de satélite ou aéreas de alta resolução, incluindo quaisquer outros dados de campo existentes de parceiros locais. Para corresponder à forma como nossos mapas são usados para testes sob o ICE CoT, com pixels de 'núcleo da floresta' ligeiramente separados da borda considerada, pontos muito próximos à borda dos trechos da floresta são excluídos da consideração.

Nosso objetivo é superar 90% de acurácia de comissão e omissão tanto para as classes de floresta quanto de não floresta, alcançando uma Acurácia Global acima de 95%.

Muitas vezes ultrapassamos isso consideravelmente, mas depende da vegetação

Tipos e complexidade da paisagem. Por exemplo, em uma paisagem brasileira com grandes blocos de floresta tropical e grandes campos de soja, com um tamanho médio de desmatamento que abrange dezenas de hectares, esperaríamos precisões gerais superiores a 99%. Mas em uma paisagem complexa com pequenos agricultores, pequenos trechos de desmatamento (<1 ha) e culturas consorciadas com árvores (por exemplo, cacau), tais níveis de precisão não são alcançáveis e devem ser vistos com desconfiança.

Usando nossos métodos avançados (combinando múltiplos tipos de dados de satélite) e conhecimento local, precisões de comissão e omissão superiores a 90% são possíveis mesmo nessas paisagens complexas.

Os testes que o ICE CoT realiza em nossos mapas são baseados na precisão dos mapas, no entendimento de que os erros nos mapas estão concentrados, especialmente nas bordas de florestas e áreas de desmatamento, e na provável precisão das unidades de GPS de campo usadas para mapear os limites dos campos.


Estudo de caso: Mapas nacionais do Camboja

O Camboja é uma paisagem onde as taxas de desmatamento são altas, com a maior parte do desmatamento sendo em pequena escala para uma variedade de culturas, incluindo arbóreas como óleo de palma, borracha e nozes-de-bétel. A floresta é uma mistura complexa de seco e úmido, incluindo áreas de pântano e manguezais.

Como estudo de caso, resumimos abaixo os resultados de um mapa de cobertura do solo de 2020 que a Space Intelligence fez como parte de um conjunto de mapas que estudam a dinâmica da cobertura do solo no país por mais de 13 anos. Os mapas mostram alta precisão e pouquíssima confusão entre floresta e não floresta, com a exclusão com sucesso de florestas plantadas, culturas arbóreas e plantações de borracha da classe florestal, como seria exigido para uma avaliação EUDR.

Tabela 1: Precisões temáticas para a linha base da floresta do Camboja da Space Intelligence para 2023, avaliada independentemente usando um desenho amostral probabilístico, mostrando alta precisão geral, mas também baixa confusão entre as classes. Todos os valores incluem o 95º intervalo de confiança.

Figura 1: Um subconjunto da linha base da floresta do Camboja da Space Intelligence, mostrando floresta em verde, não-floresta em preto e água em azul. Pontos vermelhos são alguns dos milhares de pontos aleatórios de avaliação de precisão usados para avaliar a precisão do mapa.


Apêndice: Avaliação de abordagens de precisão

A precisão pode ser testada de várias maneiras, mas a única abordagem que fornece uma avaliação significativa da precisão de um pixel aleatório no mapa de saída é a abordagem 4. Essa é a abordagem usada pela Verra na nova Metodologia Consolidada REDD+ (VM0048) e recomendada pelas diretrizes de boas práticas por 1-3, mas nem sempre é seguida por empresas interessadas em exibir estatísticas de alta precisão.

Abordagem 1: Uma comparação dos dados de treinamento de entrada (normalmente polígonos desenhados a olho com classes como 'floresta' ou 'não-floresta') em comparação com o mapa de saída. Normalmente, a unidade usada é a proporção de pixels corretamente classificados ('precisão geral'), sendo os pixels individuais a unidade de avaliação, não os polígonos inteiros.

Avaliação: Embora comum, esse método não é cientificamente apropriado, pois não há independência entre os conjuntos de dados de teste e de treinamento.

Outro problema é o uso de pixels, e não de polígonos, como base de comparação. Pixels vizinhos (por exemplo, todos os pixels que compõem um campo limpo em uma floresta) são tratados como amostras independentes, quando na verdade são vizinhos e compartilham muito mais características do que dois pixels aleatórios no mapa de saída.

Por ambos os motivos, inevitavelmente exagera a precisão.

Abordagem 2: Uma comparação semelhante do mapa de saída com polígonos, mas usando polígonos produzidos de forma independente não usados para treinar o mapa. Normalmente, a unidade usada é a proporção de pixels corretamente classificados ('precisão geral'), sendo os pixels individuais a unidade de avaliação, não os polígonos inteiros.

Avaliação: Isso compartilha a questão acima do uso do tratamento de pixels vizinhos não independentes como independentes, exagerando a precisão.

Abordagem 3: Utilizando dados coletados in situ (dados de campo).

Dados de campo são frequentemente propostos como o 'padrão-ouro' dos dados de validação, e assumidos com maior precisão do que outras fontes de dados.

Avaliação: No entanto, devido à acessibilidade e ao seu custo elevado em comparação, por exemplo, à interpretação de dados de sensoriamento remoto de alta resolução, o pequeno tamanho da amostra e a proporção estreita da área disponível para amostragem impedem que seus resultados possam ser extrapolados de forma confiável para grandes regiões.

Também tende a ser espacialmente tendenciosa, o que pode ser um problema ao avaliar produtos de cobertura do solo, já que áreas acessíveis são tipicamente mais perturbadas.

Abordagem 4: A avaliação independente de um conjunto de pontos isolados, colocados sobre todo o mapa de saída usando uma abordagem amostral estatisticamente válida (geralmente uma grade ou uma amostra aleatória estratificada).

Avaliação: essa abordagem fornece uma avaliação confiável da precisão das diferentes classes de um mapa e dos intervalos de confiança dessa avaliação. Mais pontos podem ser adicionados de forma estatisticamente válida até que os intervalos de confiança na avaliação de precisão sejam suficientemente estreitos para atender aos requisitos.

Referências:

1Olofsson, P., et al. 2014. Good practices for estimating area and assessing accuracy of land change. Remote Sensing of Environment.

2The International Panel on Climate Change (IPCC). 2003. Good Practice Guidance for Land Use, Land-use Change and Forestry.

3GFOI. 2020. Methods and Guidance from the Global Forest Observations Initiative (MGD). Edition 3.0.

Isto respondeu à sua pergunta?