Skip to content

v0.2.1: 19 new datasets (88 total)

Choose a tag to compare

@hanmingwu1103 hanmingwu1103 released this 19 Feb 16:44
· 24 commits to master since this release

New datasets (19 added, 88 total)

19 new datasets from Billard & Diday (2020) Clustering Methodology for Symbolic Data, the HistDAWass R package, and other R packages.

Interval-valued (5)

  • genome_abundances.int — 14 genome classes × 10 dinucleotide abundance intervals
  • china_temp_monthly.int — 15 Chinese weather stations × 12 monthly temperature intervals
  • ecoli_routes.int — 9 E. coli transport routes × 5 interval variables
  • loans_by_risk.int — 35 loan groups by risk level × 4 financial intervals (from MAINT.Data)
  • polish_voivodships.int — 18 Polish voivodships × 9 socio-economic intervals (from clusterSim)

Histogram-valued (9)

  • iris_species.hist — 3 iris species × 4 morphological histograms
  • flights_detail.hist — 16 airlines × 5 flight performance histograms
  • cover_types.hist — 7 forest cover types × 4 topographic histograms
  • glucose.hist — 4 regions × 1 blood glucose histogram
  • state_income.hist — 6 US states × 4 income histograms
  • simulated.hist — 5 observations × 2 simulated histograms
  • age_pyramids.hist — 229 countries × 3 age pyramid histograms (from HistDAWass)
  • ozone.hist — 84 daily observations × 4 weather histograms (from HistDAWass)
  • french_agriculture.hist — 22 French regions × 4 agricultural histograms (from HistDAWass)

Distribution-valued (1)

  • household_characteristics.distr — 12 counties × 3 categorical distributions

Mixed symbolic (4)

  • county_income_gender.hist — 12 counties with gendered income histograms + sample sizes
  • joggers.mix — 10 jogger groups with interval + histogram variables
  • census.mix — 10 census regions with 6 mixed-type variables
  • mtcars.mix — 5 car groups with 7 interval + 4 modal variables (from ggESDA)