Método · contrato 1.0.0

Metodologia das estatísticas de nomes

Definições conservadoras para descrever apenas o que as contagens oficiais permitem observar.

Análise editorial reproduzível · publicada em · dados revistos em

1. Universo observado

A unidade de entrada é uma linha publicada para um nome, ano e segmento. A versão atual contém 280 linhas de 7 anos (2017, 2018, 2019, 2020, 2021, 2022, 2023), todas com âmbito Portugal e cobertura top-20-only. [1] [2]

Os segmentos feminino e masculino são tratados separadamente. Não se fundem contagens, não se cria uma posição conjunta e não se compara uma linha de um segmento com uma linha do outro.

Regra de ausência

Ausência de uma linha significa apenas que o nome não consta do Top 20 publicado; não é convertida em zero e não permite estimar uma contagem.

2. Posições e empates

Ordenação por contagem publicada decrescente dentro do mesmo ano e segmento. Contagens iguais partilham a posição e a posição seguinte salta os lugares empatados.

Para uma lista ordenada, a posição de uma linha sem empate é o seu índice começado em 1. Se duas linhas consecutivas têm a mesma contagem, recebem a mesma posição da primeira linha empatada. Exemplo abstrato: contagens 100, 90, 90 e 80 produzem posições 1, 2, 2 e 4.

A biblioteca recalcula todas as posições e interrompe a construção se o resultado divergir da posição conservada no catálogo. O nome serve apenas para tornar a ordem de apresentação determinística dentro de um empate; não altera a posição partilhada.

3. Movimentos, entradas e saídas

Uma subida ou descida compara apenas dois anos civis consecutivos em que o nome consta dos dois Top 20 do mesmo segmento.

Definições de uma comparação entre os anos t−1 e t
MedidaCálculoInterpretação permitida
Mudança de posiçãoposição(t−1) − posição(t)Valor positivo é subida relativa dentro das duas tabelas; valor negativo é descida.
Diferença de contagemcontagem(t) − contagem(t−1)Variação absoluta da linha publicada, sem correção populacional.
Entrada no Top 20Top20(t) \ Top20(t−1)O nome aparece na tabela atual e não na anterior.
Saída do Top 20Top20(t−1) \ Top20(t)O nome aparece na tabela anterior e não na atual.

Entrada significa presença no Top 20 atual e ausência no Top 20 do ano civil anterior; saída significa o inverso. Nenhuma das duas afirma zero registos fora da tabela.

Não comparamos 2019 diretamente com 2021 se 2020 estiver ausente. Exigir anos civis consecutivos evita chamar “movimento anual” a um intervalo de duração diferente.

4. Persistência e janelas de década

Persistência conta presenças nas tabelas Top 20 dos anos disponíveis. A percentagem usa como denominador apenas esses anos, não nascimentos nem todos os nomes registados.

  • Presenças: número de anos disponíveis em que o nome consta do Top 20 do segmento.
  • Parcela dos rankings disponíveis: presenças divididas pelo número de anos publicados na janela.
  • Maior sequência: maior número de anos civis consecutivos com presença observada.
  • Melhor posição: menor valor de posição calculada na série.
  • Soma publicada: soma apenas das contagens das linhas em que o nome está presente.

Uma janela de década agrega somente anos e linhas publicados. As somas são somas das linhas Top 20 observadas e nunca totais nacionais da década.

A biblioteca declara yearsAvailable, yearCount e completeDecade. Uma janela com três anos disponíveis mantém o denominador três; não recebe sete anos artificiais nem zeros para nomes fora das tabelas.

5. Schema, versões e reprodução

A biblioteca usa schema editorial 1.0.0, deriva do catálogo 1.3.0 e reflete dados revistos em . O contrato é publicado como application/schema+json.

Campos principais da biblioteca
CampoConteúdo
annualAnalyses[].segments[].rowsLinhas integralmente ordenadas, com posição recalculada, contagem e fonte.
comparisonInterseção, entradas, saídas e movimentos entre anos consecutivos.
decadeAnalyses[].yearsAvailableDenominador explícito da janela de década.
persistence[].seriesSequência observada de ano, posição e contagem para cada nome presente.
sourcesTítulo, editor, URL, licença, cobertura e data de consulta das fontes.
  1. Descarregue as observações de base e a biblioteca derivada.
  2. Agrupe linhas por ano e segmento, mantendo apenas cobertura top-20-only.
  3. Ordene por contagem decrescente e aplique a regra de empate.
  4. Compare conjuntos apenas quando os anos diferem exatamente por um.
  5. Valide totais de linhas, somas, fontes e séries contra o schema.

6. Limites de inferência

  • Não existe uma linha para todos os nomes registados.
  • Não existe denominador populacional por nome nesta série; por isso não calculamos incidência nem quota de nascimentos.
  • A posição é relativa ao conteúdo de cada tabela, pelo que posição e contagem podem mover-se em direções diferentes.
  • Uma janela parcial não descreve a década completa.
  • As análises são descritivas e retrospetivas; não produzem previsões.
  • Não atribuímos causalidade social, regional ou demográfica a uma mudança observada.

Estas restrições fazem parte do resultado, não são notas opcionais. Qualquer reutilização deve conservar a cobertura, as fontes e a regra de ausência.

Fontes e datas de consulta

  1. Registo de Nomes (Feminino) Instituto dos Registos e do Notariado · Top 20 de nomes próprios femininos registados em Portugal; 2017–2023. Não é uma série de todos os nomes. · consultado em · licença: CC BY-SA (versão não indicada na ficha do dataset)
  2. Registo de Nomes (Masculino) Instituto dos Registos e do Notariado · Top 20 de nomes próprios masculinos registados em Portugal; 2017–2023. Não é uma série de todos os nomes. · consultado em · licença: CC BY-SA (versão não indicada na ficha do dataset)