PetLens

PetLens

갤러리

MODEL GUIDE

결과를 과하게 읽지 않는 법

PetLens는 두 모델을 한 화면에 보여주지만, 두 숫자가 의미하는 바는 다릅니다. 아래 세 가지만 기억하면 됩니다.

HOW TO USE

각 섹션은 이렇게 사용하세요

홈에서 탐색 → 문장 검색 → 사진 분석 → 상세 확인 순서로 사용하면 각 모델이 무엇을 보여주는지 자연스럽게 연결됩니다.

01

GALLERY

먼저 37개 품종 레퍼런스를 둘러보세요

홈의 기본 상태는 Oxford-IIIT Pet의 37개 품종 레퍼런스를 그대로 보여줍니다. 특정 결과를 해석하기 전에 어떤 품종과 이미지가 기준 집합에 포함되어 있는지 먼저 훑어보면 이후 CLIP과 ViT 결과를 훨씬 쉽게 이해할 수 있습니다.

사진을 선택하면 해당 레퍼런스의 품종, 데이터셋 정보, 모델 지표와 원본 출처를 확인할 수 있습니다.

02

CLIP · TEXT → IMAGE

품종명이 아니라 장면을 문장으로 검색하세요

홈의 ‘의미 기반 검색’ 카드에 원하는 특징을 영어 문장으로 입력하세요. 예를 들어 ‘a small white fluffy dog’처럼 외형이나 장면을 설명하면 CLIP이 텍스트와 각 이미지의 의미적 유사도를 계산해 37개 갤러리의 순서를 다시 정렬합니다.

검색 점수는 품종 확률이 아닙니다. 같은 검색 안에서 어떤 이미지가 상대적으로 더 위에 있는지를 보는 용도입니다.

03

VIT · PHOTO ANALYSIS

내 사진은 ‘품종 예측’과 ‘유사 이미지 검색’을 함께 보세요

‘품종 분석’ 카드에서 사진을 업로드하면 먼저 고양이·강아지를 감지합니다. 강아지는 130개 Dog-130 클래스, 고양이는 기존 Pet-37 클래스 안에서 Top-5를 반환하며, 동시에 CLIP은 기존 37개 레퍼런스 갤러리를 시각적 유사도 순으로 다시 정렬합니다.

ViT 1위 품종과 CLIP 유사 이미지 1위가 달라도 정상입니다. 두 모델은 서로 다른 질문에 답합니다.

04

DETAIL VIEW

상세 화면에서는 결과의 기준과 출처를 확인하세요

갤러리 카드나 검색 결과를 열면 해당 이미지가 어떤 품종 레퍼런스인지, 데이터셋이 무엇인지, ViT의 과제 평가 지표가 무엇인지 확인할 수 있습니다. ‘출처’ 버튼은 원본 사진 제공 페이지로 연결됩니다.

상세 화면의 91.41% 정확도와 91.32% Macro F1은 해당 한 장의 예측 확률이 아니라 전체 평가셋에서 측정한 모델 지표입니다.

05

VIDEO · ACTION TIMELINE

영상에서는 개체 추적과 행동 타임라인을 함께 보세요

영상을 업로드하면 첫 샘플 프레임에서 고양이와 강아지를 찾고 SAM2가 각 개체를 최대 12개 샘플 프레임에서 추적합니다. 각 track의 대표 crop은 품종 분류와 CLIP 검색에 사용되고, 동시에 CLIP zero-shot 장면 의미와 track 이동량을 결합해 서 있기·앉기·걷기·달리기·점프·먹기·물 마시기·놀기·그루밍·잠자기·눕기 중 행동 후보를 시간 구간별로 표시합니다.

ACTION의 숫자는 학습된 행동 확률이 아니라 zero-shot 상대 점수입니다. 실제 행동을 확정하는 용도가 아니라 영상에서 무엇이 일어나는지 빠르게 탐색하는 신호로 읽으세요.

HOW TO READ RESULTS

결과 숫자는 이렇게 읽으세요

CLIP · TEXT → IMAGE

점수는 확률이 아닙니다

검색 결과의 숫자는 텍스트와 이미지 임베딩의 유사도입니다. 절대값보다 같은 검색 안에서의 순위를 읽는 것이 중요합니다.

VIT · TOP-5

강아지 130종 · 고양이 Pet-37

PetLens 2.0은 감지 결과가 강아지면 Tsinghua Dogs 기반 Dog-130 모델에서 Top-5를 반환하고, 고양이는 기존 Oxford-IIIT Pet 37-class 모델을 사용합니다. 각 분류기는 자신의 label set 밖 품종을 새로 만들어내지 않습니다.

CLIP · IMAGE → IMAGE

유사 이미지는 분류 결과와 별개입니다

업로드 후 갤러리 순위는 CLIP 이미지 임베딩으로 계산됩니다. ViT 1순위 품종과 항상 같은 순서가 나올 필요는 없습니다.

과제 지표와 웹 런타임을 구분합니다.

README의 91.41% ViT 정확도와 CLIP Recall@K는 실행된 Colab 노트북의 측정값입니다.