Acerca de los Datos / Sobre os dados

Autor/a

IDASH Sudamérica / IDASH Ámérica do Sul

Fecha de publicación

20 de noviembre de 2025

Los datos / Os dados

Vamos a usar como base los datos de la esperanza de vida por cada país, para el periodo entre el 2000 y el 2015. Estos datos fueron recolectados por Kumar Rajarshi, y publicados como un conjunto de datos en Kaggle: Life Expectancy (WHO) - Statistical Analysis on factors influencing Life Expectancy

Del conjunto completo de datos, vamos a seleccionar los registros pertenecientes a los países que participan en la segunda cohorte de IDASH SAM: Argentina, Brasil, Chile, Ecuador, Paraguay y Perú, a los cuales agregaremos a Georgia que usaremos en los ejemplos siguientes.

Vamos a guardar los datos seleccionados en el archivo idash-data.csv.

Utilizaremos como base os dados de expectativa de vida de cada país, referentes ao período entre 2000 e 2015. Esses dados foram coletados por Kumar Rajarshi e publicados como um conjunto de dados no Kaggle: Life Expectancy (WHO) - Statistical Analysis on factors influencing Life Expectancy.

Do conjunto de dados completo, selecionaremos os registros dos países participantes da segunda coorte do IDASH SAM: Argentina, Brasil, Chile, Equador, Paraguai e Peru, à qual acrescentaremos a Geórgia, que utilizaremos nos exemplos seguintes.

Vamos salvar os dados selecionados no arquivo idash-data.csv.

Seleccionando los datos / Selecionando os dados

library(dplyr)

paises <- c(
  "Argentina",
  "Brazil",
  "Chile",
  "Ecuador",
  "Paraguay",
  "Peru",
  "Georgia"
)

idash_data <- read_csv("data/Life Expectancy Data.csv") |> 
  filter(Country %in% paises)
write_csv(idash_data, "data/idash-data.csv")
import pandas as pd

paises = [
  "Argentina",
  "Brazil",
  "Chile",
  "Ecuador",
  "Paraguay",
  "Peru",
  "Georgia"
]

who_data = pd.read_csv("data/Life Expectancy Data.csv")
idash_data = who_data[who_data["Country"].isin(paises)]
idash_data.to_csv("data/idash-data.csv", index=False)

Una muestra de los datos / Uma amostra dos dados

Vamos a seleccionar una muestra de 10 registros aleatoriamente de todo el conjunto de datos, para tener una idea del contenido

Selecionaremos aleatoriamente uma amostra de 10 registros de todo o conjunto de dados para termos uma ideia do conteúdo.

Muestra de datos de IDASH (n=10)
Country Year Status Life expectancy Adult Mortality infant deaths Alcohol percentage expenditure Hepatitis B Measles BMI under-five deaths Polio Total expenditure Diphtheria HIV/AIDS GDP Population thinness 1-19 years thinness 5-9 years Income composition of resources Schooling
Argentina 2002 Developing 74.1 138 12 7.81 470.186915 66 0 55.1 13 94 8.31 93 0.1 2579.1932 3788937 1.2 1.0 0.776 16.3
Ecuador 2013 Developing 76.0 121 6 3.77 59.128502 87 0 52.8 8 87 7.29 87 0.1 674.9829 15661547 1.3 1.1 0.725 13.4
Georgia 2000 Developing 71.8 129 2 3.28 47.817042 55 50 46.0 2 81 6.94 8 0.1 691.9977 44183 3.1 3.1 0.000 11.4
Paraguay 2006 Developing 72.3 161 3 5.61 26.180724 92 0 43.5 4 98 6.43 98 0.2 189.7154 5882796 2.2 2.2 0.648 12.1
Paraguay 2004 Developing 71.9 165 3 6.20 20.600830 9 0 42.0 4 92 5.78 92 0.2 148.5280 57374 2.3 2.2 0.639 12.1
Brazil 2008 Developing 73.4 158 61 7.21 526.378064 96 0 5.3 68 99 8.24 99 0.1 8787.6138 19297929 3.0 3.0 0.704 13.3
Ecuador 2006 Developing 74.4 144 8 3.52 19.139833 96 0 47.9 9 92 5.86 96 0.3 335.7865 1396748 1.4 1.3 0.693 12.8
Paraguay 2003 Developing 71.7 166 4 6.64 155.423308 86 0 41.3 4 86 5.99 86 0.1 1174.7793 56795 2.4 2.3 0.642 12.7
Georgia 2005 Developing 73.9 128 1 4.70 9.444875 79 1356 48.6 1 82 8.60 82 0.1 153.5752 419 2.8 2.9 0.703 12.2
Paraguay 2000 Developing 79.0 172 4 6.78 273.575877 NA 0 39.1 5 86 8.10 86 0.1 1545.6264 5327 2.5 2.4 0.625 11.6

Diccionario de datos / Dicionário de dados

Para entender mejor los datos, este un diccionario de datos que hemos elaborado a partir de los contenidos, y tomando en cuenta las fuentes que el curador original de los datos empleó.

Para melhor compreender os dados, elaboramos um dicionário de dados a partir do conteúdo, levando em consideração as fontes utilizadas pelo curador de dados original.

Diccionario de datos / Dicionário de dados
item label class summary value
Rows in dataset 112
Columns in dataset 22
Country Country Name factor Argentina (1) 16
Brazil (2) 16
Chile (3) 16
Ecuador (4) 16
Georgia (5) 16
Paraguay (6) 16
Peru (7) 16
missing 0
Year Year factor 2000 (1) 7
2001 (2) 7
2002 (3) 7
2003 (4) 7
2004 (5) 7
2005 (6) 7
2006 (7) 7
2007 (8) 7
2008 (9) 7
2009 (10) 7
2010 (11) 7
2011 (12) 7
2012 (13) 7
2013 (14) 7
2014 (15) 7
2015 (16) 7
missing 0
Status Developed or Developing status factor Developing (1) 112
missing 0
Life expectancy Life Expectancy in years numeric mean 75
median 74
min 71
max 85
missing 0
Adult Mortality Adult Mortality Rates of both sexes (probability of dying between 15 and 60 years per 1000 population) numeric mean 119
median 132
min 1
max 183
missing 0
infant deaths Number of Infant Deaths per 1000 population numeric mean 15
median 7
min 1
max 111
missing 0
Alcohol Alcohol, recorded per capita (15+) consumption (in litres of pure alcohol) numeric mean 6
median 6
min 0.01
max 8.65
missing 7
percentage expenditure Expenditure on health as a percentage of Gross Domestic Product per capita(%) numeric mean 399
median 187
min 0
max 2442.22
missing 0
Hepatitis B Hepatitis B (HepB) immunization coverage among 1-year-olds (%) numeric mean 83
median 91
min 9
max 99
missing 14
Measles Measles - number of reported cases per 1000 population numeric mean 203
median 0
min 0
max 7872
missing 0
BMI Average Body Mass Index of entire population numeric mean 48
median 50
min 4.6
max 63.8
missing 0
under-five deaths Number of under-five deaths per 1000 population numeric mean 17
median 9
min 1
max 127
missing 0
Polio Polio (Pol3) immunization coverage among 1-year-olds (%) numeric mean 85
median 92
min 8
max 99
missing 0
Total expenditure General government expenditure on health as a percentage of total government expenditure (%) numeric mean 7
median 7
min 1.19
max 9.81
missing 7
Diphtheria Diphtheria tetanus toxoid and pertussis (DTP3) immunization coverage among 1-year-olds (%) numeric mean 89
median 93
min 8
max 99
missing 0
HIV/AIDS Deaths per 1 000 live births HIV/AIDS (0-4 years) numeric mean 0
median 0
min 0.1
max 0.5
missing 0
GDP Gross Domestic Product per capita (in USD) numeric mean 4060
median 2787
min 63.34
max 15941.4
missing 0
Population Population of the country numeric mean 21685027
median 5924478
min 43
max 198686688
missing 0
thinness 1-19 years Prevalence of thinness among children and adolescents for Age 10 to 19 (%) numeric mean 2
median 1
min 0.8
max 3.4
missing 0
thinness 5-9 years Prevalence of thinness among children for Age 5 to 9(%) numeric mean 2
median 1
min 0.8
max 3.4
missing 0
Income composition of resources Human Development Index in terms of income composition of resources (index ranging from 0 to 1) numeric mean 1
median 1
min 0
max 0.84
missing 0
Schooling Number of years of Schooling numeric mean 14
median 13
min 11.4
max 17.3
missing 0

Nota: Generado con R / Gerado com R

En la siguiente página vamos a ver unos ejemplos de cálculos de estadísticas descriptivas usando R y Python.

Na próxima página, veremos alguns exemplos de cálculos de estatísticas descritivas usando R e Python.