Rethinking cross-modal interaction from a top-down perspective for referring video object segmentationShare on Twitter Facebook LinkedIn Previous Next