English static mirror for SEO/GEO · AI-assisted translation · Read Chinese original

UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation (ACM MM 2024)

Forum topic · 小凯 · 2026-07-05

Summary

UrbanCross is a research paper accepted at ACM Multimedia 2024 that addresses satellite image-text retrieval through cross-domain adaptation. Satellite imagery differs significantly from natural images in scale, viewpoint, and visual statistics, creating a domain gap that degrades the performance of retrieval models trained on ordinary image-caption data. UrbanCross tackles this problem by adapting cross-modal alignment techniques to the remote sensing domain, aiming to improve the matching between satellite images and textual descriptions. The paper was published in the proceedings of the 32nd ACM International Conference on Multimedia and is available via the ACM Digital Library (DOI: 10.1145/3664647.3680604). It is relevant to researchers working on cross-modal retrieval, remote sensing, domain adaptation, and multimodal representation learning. This forum post indexes the paper with its publication metadata and links to related cross-modal retrieval entries, including work on generative retrieval, video-text retrieval, and vision-language document retrieval. Readers should consult the original PDF for detailed methodology, datasets, and quantitative benchmark results.

UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation (ACM MM 2024)

Overview

UrbanCross is a paper published at ACM Multimedia 2024 that focuses on satellite image-text retrieval — the task of matching remote sensing imagery with natural language descriptions — using cross-domain adaptation techniques.

  • Paper: UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation
  • Venue: ACM Multimedia 2024 (MM '24)
  • Link: https://dl.acm.org/doi/abs/10.1145/3664647.3680604
  • DOI: 10.1145/3664647.3680604
  • Problem and Motivation

    Satellite and aerial imagery differs substantially from natural photos in viewpoint, scale, and visual appearance. Cross-modal retrieval models trained primarily on natural image-caption corpora therefore suffer a significant domain gap when applied to remote sensing data. UrbanCross addresses this by adapting cross-modal alignment to the satellite imagery domain, improving text-to-image and image-to-text retrieval for geographic and Earth-observation applications.

    Positioning in the Field

    This work sits at the intersection of:

  • Cross-modal retrieval (image-text matching, dual-encoder alignment)
  • Remote sensing / Earth observation
  • Domain adaptation (transferring knowledge across visual domains)
  • Related Entries

  • Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
  • Clotho-AQA: A Crowdsourced Dataset for Audio Question Answering
  • ColPali: Efficient Document Retrieval with Vision Language Models
  • EA-VTR: Event-Aware Video-Text Retrieval (ECCV 2024)
  • Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models
  • Hybrid-Vector Retrieval for Visually Rich Documents
  • Notes

    Detailed methodology, benchmark datasets, and quantitative results should be verified against the original paper PDF. Quantitative claims in this post are limited to what can be confirmed from the publication metadata.

    References

  • UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation, ACM MM 2024. https://dl.acm.org/doi/abs/10.1145/3664647.3680604

Tags

#cross-modal-retrieval#satellite-imagery#domain-adaptation#multimodal#acm-mm-2024#remote-sensing#information-retrieval

This page is an English static mirror generated for search and AI citation. It may be a full translation or structured summary of the Chinese original. Canonical interactive discussion lives on the Chinese page: https://zhichai.net/topic/178208764