Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis

Nietert, Sloan; Cummings, Rachel; Goldfeld, Ziv

Statistics > Machine Learning

arXiv:2111.01361 (stat)

[Submitted on 2 Nov 2021 (v1), last revised 28 Feb 2023 (this version, v4)]

Title:Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis

Authors:Sloan Nietert, Rachel Cummings, Ziv Goldfeld

View PDF

Abstract:The Wasserstein distance, rooted in optimal transport (OT) theory, is a popular discrepancy measure between probability distributions with various applications to statistics and machine learning. Despite their rich structure and demonstrated utility, Wasserstein distances are sensitive to outliers in the considered distributions, which hinders applicability in practice. We propose a new outlier-robust Wasserstein distance $\mathsf{W}_p^\varepsilon$ which allows for $\varepsilon$ outlier mass to be removed from each contaminated distribution. Under standard moment assumptions, $\mathsf{W}_p^\varepsilon$ is shown to achieve strong robust estimation guarantees under the Huber $\varepsilon$-contamination model. Our formulation of this robust distance amounts to a highly regular optimization problem that lends itself better for analysis compared to previously considered frameworks. Leveraging this, we conduct a thorough theoretical study of $\mathsf{W}_p^\varepsilon$, encompassing robustness guarantees, characterization of optimal perturbations, regularity, duality, and statistical estimation. In particular, by decoupling the optimization variables, we arrive at a simple dual form for $\mathsf{W}_p^\varepsilon$ that can be implemented via an elementary modification to standard, duality-based OT solvers. We illustrate the virtues of our framework via applications to generative modeling with contaminated datasets.

Comments:	updated to match AISTATS publication
Subjects:	Machine Learning (stat.ML); Machine Learning (cs.LG)
Cite as:	arXiv:2111.01361 [stat.ML]
	(or arXiv:2111.01361v4 [stat.ML] for this version)
	https://doi.org/10.48550/arXiv.2111.01361

Submission history

From: Sloan Nietert [view email]
[v1] Tue, 2 Nov 2021 04:05:45 UTC (4,697 KB)
[v2] Fri, 5 Nov 2021 18:31:46 UTC (4,697 KB)
[v3] Sun, 27 Feb 2022 01:02:32 UTC (3,060 KB)
[v4] Tue, 28 Feb 2023 19:20:45 UTC (2,255 KB)

Statistics > Machine Learning

Title:Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis

Submission history

Access Paper:

References & Citations

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators

Statistics > Machine Learning

Title:Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis

Submission history

Access Paper:

References & Citations

BibTeX formatted citation

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators