As listas de espécies já geradas podem ser baixadas aqui:
Você pode ler ou baixar listas individuais aqui: ChecklistsBrazil
A ferramenta IntegraFlora consiste em um pacote R e uma coleção de scripts que devem ser executados sequencialmente, assim como scripts para construção dos arquivos auxiliares de entrada. Para usar a ferramenta para gerar novas listas de espécie, o usuário precisa baixar os dados de ocorrência de espécies da área desejada (eg, do estado de São Paulo) das fontes de dados, e salvar os arquivos nas pastas especificadas no README. Os arquivos auxiliares (de descrição das UCs) estão inclusos no repositório, mas também podem ser atualizados pelo usuário.
Nos primeiros scripts, em analyses/formatData/, os dados de ocorrência das diferentes fontes são padronizados, garantindo que os nomes das colunas estejam no padrão DarwinCore e que colunas com os mesmos nomes estejam no mesmo padrão de formatação. Em seguida, no script analyses/joinData.R, os dados são consolidados em uma única tabela e formatados com auxílio do pacote plantR. Nessa etapa, os nomes de coletores e identificadores são padronizados, assim como datas, números de coleta e códigos institucionais. Além disso, fazemos o tratamento e correção dos campos de localidade, a atribuição e checagem de coordenadas geográficas, a correção dos nomes científicos, e a atribuição de um valor de confiança da identificação, baseada na especialização do identificador.
Com os dados tratados e checados, o script analyses/deduplicate.R aplica o algoritmo de detecção de duplicatas, baseado em combinações de sobrenome do coletor, ano de coleta, local de coleta, família ou espécie, e número de coleta. A detecção de duplicatas reduz drasticamente o volume de dados ao remover as duplicatas virtuais (mesmo registro de herbário, baixado de bancos de dados diferentes), e ajuda a completar dados faltantes ou corrigir identificações pouco confiáveis.
A partir daqui, temos uma tabela de ocorrências, que filtramos para conter apenas ocorrências do estado de São Paulo. No script analyses/getOccs.R, essas ocorrências serão filtradas por seus campos de município, localidade e coordenadas geográficas para gerar arquivos separados para cada UC, contendo todas as ocorrências associadas àquela UC, com diferentes graus de confiança de acordo com a origem da associação (mais detalhes abaixo). Por fim, no script analyses/treatOccs.R, são selecionadas as ocorrências com maior grau de confiança para cada táxon, e essas são organizadas em listas de espécie ordenadas por família e nome científico.
Esta ferramenta foi desenvolvida inteiramente em linguagem R.
Para utilizá-la, é preciso ter instalado o R com versão pelo menos 4.3, e baixar este repositório.
O repositório pode ser baixado por git (pela ferramenta de terminal do git, git clone https://github.com/Lobz/IntegraFlora.git) ou em formato zip (https://github.com/Lobz/IntegraFlora/archive/refs/heads/main.zip) e depois extraído.
Para instalar o pacote num sistema Debian ou Ubuntu, recomendo usar a ferramenta make executando no terminal:
make installCaso esteja em outro tipo de sistema operacional, abra um terminal de R, e execute:
install.packages('devtools')
devtools::install()O devtools pedirá permissão para instalar todas as dependências do pacote. Algumas dependências requerem bibliotecas de sistema específicas que precisam ser instalados à parte. A lista de bibliotecas para Debian/Ubuntu estão no script de bash install_deps_linux.sh e são instaladas automaticamente pelo make, mas outros sistemas podem ter dependências correspondentes.
- analyses/ - scripts para tratamento dos dados
- formatData - scripts de padronização dos dados de cada fonte
- data - dados usados pela ferramenta
- data-input - dados de ocorrência e localidade fornecidos pelo usuário -Occurrences - dados brutos de ocorrência - GBIF - arquivos baixados do GBIF - JABOT - arquivos baixados do JABOT - Reflora - arquivos baixados do Reflora - splink - arquivos baixados do splink - OtherSources - outros arquivos, no padrão darwinCore. -Locations - dados sobre as UCs - info - listas com nomes e locais das UCs - shapes - arquivos .shp com mapas das UCs
- data-tmp - arquivos intermediários criados por esta ferramenta
- plots - figuras
- R - funções usadas pelos scripts
- results - resultados, incluindo as listas de espécies
- checklists - listas de espécies no formato do Catálogo de Plantas das UCs do Brasil, em formato .csv. Cada UC pode gerar até três arquivos:
- NOME_DA_UC_modeloCatalogo.csv - lista principal, contendo apenas o melhor representante de cada táxon.
- NOME_DA_UC_extra.csv - para cada táxon da lista principal, este arquivo contém até 5 outros representantes, que podem ser usados caso haja algum problema com o da lista principal.
- NOME_DA_UC_nomesInvalidos.csv - registros associados à UC, mas com nomes taxonômicos faltantes, incorretos ou que não foram encontrados nas floras de referência (BFO, WFO ou WCVP) por qualquer motivo.
- total - todos os registros encontrados em cada UC, em formato .rda
- total-treated - todos os registros encontrados em cada UC, em formato .csv
- summary_getOccs.csv - resumo do número e grau de confiança de localidade dos registros encontrados para cada UC
- summary_treatOccs.csv - resumo do número e grau de confiança de identificação dos registros encontrados para cada UC
- UCsummary.csv - tabela final de UCs que foram consideradas. Gerada a partir dos arquivos em data-input/Locations/info
- checklists - listas de espécies no formato do Catálogo de Plantas das UCs do Brasil, em formato .csv. Cada UC pode gerar até três arquivos:
-
Antes de começar, edite o arquivo config.R, selecionando o estado de interesse. Por padrão, a ferramenta restringe os dados a apenas um estado antes de aplicar os algoritmos mais pesados de tratamento.
-
Baixe os dados brutos atualizados das bases de dados. Podem ser baixados vários arquivos de cada plataforma, e os dados duplicados serão removidos automaticamente. Este repositório vem com alguns arquivos de exemplo. As plataformas aceitas são as seguintes:
- GBIF - arquivos .zip
- Reflora - arquivos .csv
- splink (obs.: para baixar dados em grandes quantidades, será necessário criar uma conta) - arquivos .txt
- JABOT - arquivos .csv
- Outras fontes de dados podem ser usadas, adicionando arquivos .csv na pasta OtherSources. Os arquivos devem ter colunas nomeadas no padrão Darwin Core em inglês. Obs.: é possível baixar dados Jabot e Reflora neste formato usando a função downloadIPTResource.
Os dados devem ser salvos nas respectivas pastas dentro de data-input/Occurrences/. No caso de mais de um arquivo serem salvos na mesma pasta, o script combinará os dados dos arquivos diferentes antes de iniciar o tratamento dos dados. No caso dos dados Reflora, por favor abra os arquivos e salve como csv na mesma pasta antes de prosseguir.
-
Para executar a geração de listas, você pode usar a ferramenta
make, ou executar o script make.R. Alternativamente, para garantir que cada etapa executada por esse script funciona corretamente, ou para customizar a execução, siga os passos:3.1. Execute o script config.R
3.2. Execute os scripts da pasta analyses/formatData/.
3.3. Execute o script analyses/joinData.R. Esse script pode consumir muita memória e processamento, dependendo do número de registros. Por isso, garanta que os recursos de seu computador estejam disponíveis. Antes dessa etapa, você pode opcionalmente adicionar sinônimos de localidades no arquivo results/locations/locGazetteer.csv.
3.4. Opcionalmente, adicione nomes alternativos de localidades na tabela de nomes alternativos.
3.5. Execute os scripts analyses/getOccs.R e analyses/treatOccs.R.
Obs: para customizar a pasta onde os arquivos são armazenados, você pode usar as variáveis e ambiente ou variáveis de make RESULTS_DIR (para resultados) e DATATMP (para arquivos intermadiários).
-
Você pode produzir algumas estatísticas e figuras a partir dos seus resultados usando o script analyses/resultStats.R.
-
Os resultados podem ser encontrados na pasta results/checklist.
A partir dos totais de registros associados a cada UC, as listas finais são produzidas selecionando-se um registro para representar cada espécie, variedade, forma ou subspécie, além de um registro para representar cada gênero ou família não representado por registros com identificações mais precisas. Esses representantes são selecionados de acordo com os critérios de confiança em localidade e identificação, na escala "Ouro">"Prata">"Bronze">"Latão", e em caso de empate, na presença de informação de barcode e em quão recente foi a coleta.
O critério de confiança em localização se baseia em qual foi o método de seleção utilizado, de acordo com a seguinte tabela:
| Categoria | Fonte da seleção | Grau de confiança |
|---|---|---|
| locality_exact | Busca pelos nomes da UC usando expressões regulares nos campos textuais | Ouro |
| plantr_exact | Identificador de localidade plantR idêntico ao da UC em algum município | Ouro |
| intersect_high | Registros encontrados pelos dois métodos anteriores em UCs com mais de 98% de sua área dentro da UC alvo | Ouro |
| intersect_medium | Registros encontrados pelos dois métodos anteriores em UCs com mais de 80% de sua área dentro da UC alvo | Prata |
| coords_original | Coordenadas originais do registro | Bronze |
| coords_gazet | Coordenadas da localidade, obtidas do gazeteiro | Prata |
| coords_both | Ambas as coordenadas originais e da localidade | Ouro |
O critério de confiança na identificação depende da especialização do identificador ou do coletor, usando os valores da coluna tax_check produzida pela função validateTax do pacote plantR:
| tax_check | Significado | Grau de confiança |
|---|---|---|
| high | Identificador é taxonomista especialista da família | Ouro |
| medium | Identificador é taxonomista generalista | Prata |
| low | Identificador não é nem especialista nem generalista | Bronze |
| unkown | Identificador não está listado | Latão |
Esta ferramenta foi financiada pela FAPESP como parte do projeto 2024/07747-9 - "Aprimoramento e integração de bases de dados geoespaciais sobre a flora paulista", filiado ao Biota Síntese.
Mali Oz C. Salles (autor correspondente) Renato A. F. Lima Renata Ivanauskas Thuane Bochorny Guilherme S. Grittz Pablo Pains Andre M. Pereira Marisa Domingos