화이트보드 앞에서 함께 코드를 검토하는 개발자들
  • AI
  • LinkVision 비전 AI

LinkVision 비전 AI

LinkVision 은 이미지와 영상을 읽는 모델입니다. 영수증 한 장부터 공장 검사 라인까지, 사람이 눈으로 하던 확인 작업을 대신합니다.

OVERVIEW

LinkVision 개요

한 모델이 다섯 가지 일을 합니다. 기능마다 따로 붙일 필요가 없습니다.

LinkVision-V3 는 하나의 백본 위에 다섯 개의 처리 갈래를 얹은 구조입니다. 문자 인식, 객체 탐지, 얼굴 비식별, 문서 분류, 불량 검출을 같은 모델이 처리합니다. 기능마다 별도 모델을 띄우면 GPU 를 다섯 배로 써야 하지만, 이 구조에서는 이미지를 한 번만 읽고 필요한 결과만 골라 받습니다.

학습에는 4억 8,000만장의 이미지를 썼습니다. 이 중 한국어 문서와 간판 · 표지판 이미지가 1억 1,200만장입니다. 세로쓰기, 표 안에 갇힌 숫자, 손글씨가 섞인 서식처럼 국내 서류에서 자주 나오는 형태를 집중적으로 넣었습니다.

V3 는 2025년 8월에 나왔고 이전 버전보다 문서 인식 정확도가 2.4%p 올랐습니다. 더 크게 달라진 것은 속도입니다. 같은 GPU 한 장에서 초당 처리량이 860장에서 1,400장으로 늘었습니다.

98.7%OCR 정확도
1,400장/초최대 처리량
4.8억장학습 이미지
11인식 지원 언어
CAPABILITIES

다섯 가지 기능

기능마다 요구되는 정확도의 성격이 다릅니다. 숫자를 그대로 비교하지 마십시오.

기능별 성능 (GPU 1장 · 1,920×1,080 기준)
기능정확도처리 속도평균 지연정확도 기준
문자 인식 (OCR)98.7%초당 1,400장62ms글자 단위 일치율
객체 탐지mAP 91.4%초당 320프레임28msIoU 0.5 기준
얼굴 비식별재현율 99.2%초당 540장41ms실제 얼굴 검출 누락률 0.8%
문서 분류96.8%초당 2,100건19ms38개 서식 분류 정답률
불량 검출94.3%초당 180장74ms미검출률 0.4% 조건에서
  • 문자 인식 : 인쇄체 · 손글씨 · 세로쓰기 · 표 구조를 함께 인식하며 좌표까지 돌려줍니다
  • 객체 탐지 : 사전 정의 1,240개 범주 외에 문장으로 대상을 지정하는 방식도 지원합니다
  • 얼굴 비식별 : 원본 복구가 불가능한 방식으로 처리하며 누락보다 과잉 처리를 택하도록 조정했습니다
  • 문서 분류 : 계약서 · 세금계산서 · 신분증 · 진단서 등 38개 서식을 구분합니다
  • 불량 검출 : 정상 이미지만으로 학습하는 방식을 함께 제공해 불량 표본이 적어도 쓸 수 있습니다

불량 검출 정확도는 산업과 품목에 따라 크게 달라지므로 도입 전 표본 검증을 권합니다.

FORMATS

지원 포맷과 해상도

들어오는 파일을 그대로 받습니다. 사전 변환이 필요 없습니다.

입력 포맷별 제한
포맷최대 해상도최대 용량다중 페이지비고
JPEG · PNG · WebP8,192 × 8,19220MB해당 없음가장 빠른 경로
TIFF8,192 × 8,19260MB최대 200쪽스캐너 원본 그대로 처리
PDFA0 (841 × 1,189mm)80MB최대 500쪽텍스트 레이어 있으면 우선 사용
HEIC · HEIF8,192 × 8,19220MB해당 없음모바일 촬영본 자동 변환
MP4 · MOV (H.264)3,840 × 2,1602GB최대 30분프레임 샘플링 간격 지정 가능

최소 권장 해상도는 문자 높이 기준 12픽셀입니다. 그보다 작으면 인식률이 급격히 떨어지므로, 촬영 단계에서 해상도를 확보하는 편이 후처리보다 효과적입니다. 기울어진 사진은 자동으로 반듯하게 펴고, 그림자와 반사도 전처리 단계에서 보정합니다.

INDUSTRY

산업별 적용

같은 모델이지만 산업마다 붙는 자리가 다릅니다.

제조

외관 검사 라인

컨베이어 위 부품을 초당 180장 검사합니다. 국내 전자부품 업체 도입 사례에서 검사 인력 12명이 하던 일을 4명이 관리하는 구조로 바뀌었고, 미검출률은 0.4% 이하를 유지했습니다.

금융

서류 자동 심사

신분증 · 소득증명 · 통장 사본을 읽어 항목을 채웁니다. 위변조 흔적 탐지를 함께 수행하며, 대출 서류 접수 처리 시간이 평균 18분에서 3분 40초로 줄었습니다.

물류

송장 인식과 적재 검수

컨베이어를 지나는 상자의 송장 번호를 읽고 파손 여부를 함께 확인합니다. 하루 처리 물량 240만건 규모 센터에서 오분류율 0.07% 를 기록했습니다.

유통

진열 상태 점검

매장 선반 사진에서 결품과 진열 오류를 찾아냅니다. 점포 순회 인력이 사진만 올리면 되고, 결품 발견까지 걸리는 시간이 하루 단위에서 20분 단위로 짧아졌습니다.

ON-DEVICE

온디바이스 경량 모델

서버로 사진을 보내기 곤란한 곳을 위해 기기 안에서 도는 모델을 따로 만듭니다.

신경망 노드가 연결된 형태의 추상 그래픽

사진을 밖으로 내보내지 않습니다

신분증 촬영, 의료 서식, 공장 내부 영상처럼 이미지 자체가 밖으로 나가면 안 되는 경우가 있습니다. LinkVision-Lite 는 이런 환경을 위해 만든 62MB 짜리 모델입니다. 최근 3년 내 출시된 보급형 스마트폰에서도 한 장에 0.4초 안에 결과를 냅니다.

정확도는 서버 모델보다 낮습니다. 문자 인식 기준 94.1% 로 4.6%p 차이가 납니다. 대신 네트워크가 끊겨도 동작하고, 이미지가 기기 밖으로 나가지 않으므로 개인정보 처리 부담이 크게 줄어듭니다.

  • 모델 크기 : 62MB (8비트 양자화 기준)
  • 필요 메모리 : 340MB
  • 처리 시간 : 보급형 단말 0.41초 · 상위 단말 0.18초
  • 지원 기능 : 문자 인식 · 문서 분류 · 얼굴 비식별 3종
  • 문자 인식 정확도 : 94.1% (서버 모델 대비 4.6%p 낮음)
  • 배포 방식 : 모바일 SDK · 산업용 엣지 장비 컨테이너
API

호출 방법

이미지 URL 이나 base64 를 보내고, 필요한 기능만 골라 요청합니다.

  • features 에 필요한 기능만 넣으면 그만큼 비용과 지연이 줄어듭니다
  • return_boxes 를 켜면 각 글자 덩어리의 좌표를 함께 받습니다
  • 동영상은 /v1/vision/video 로 보내고 프레임 간격을 지정합니다
  • 대량 처리는 배치 엔드포인트를 쓰면 건당 단가가 38% 낮아집니다

문서 인식 요청과 응답

POST /v1/vision/analyze HTTP/1.1
Host: api.linkhub.example.com
Authorization: Bearer lh_live_9f2c4a7b1e8d
Content-Type: application/json

{
"model": "linkvision-v3",
"image_url": "https://cdn.example.com/upload/receipt_0311.png",
"features": ["ocr", "document_class"],
"language": "ko",
"return_boxes": true
}

HTTP/1.1 200 OK
Content-Type: application/json

{
"request_id": "vis_4b81e02a",
"document_class": {"label": "영수증", "confidence": 0.981},
"blocks": [
{"text": "합계", "confidence": 0.996, "box": [412, 880, 486, 918]},
{"text": "38,400원", "confidence": 0.993, "box": [640, 880, 812, 918]}
],
"page_count": 1,
"elapsed_ms": 64
}
ONBOARDING

도입 절차

표본 검증 없이 계약부터 하지 않습니다. 안 맞으면 안 맞는다고 알려 드립니다.

  1. 업무 정의

    어떤 이미지를 어떤 판단으로 바꾸고 싶은지 정리합니다. 이 단계에서 비전 AI 로 풀 문제가 아니라고 판단되는 경우가 전체 문의의 17.2% 입니다.

  2. 표본 검증

    실제 이미지 300~1,000장을 받아 무상으로 정확도를 측정합니다. 소요 기간은 영업일 5일이며 결과는 기능별 수치로 제출합니다.

  3. 파일럿

    한 개 라인 또는 한 개 지점에 4주간 적용합니다. 기존 방식과 나란히 돌려 실제 차이를 확인합니다.

  4. 도메인 튜닝

    필요하면 고객사 이미지로 추가 학습합니다. 보통 2,000~8,000장이면 정확도가 3~7%p 오릅니다. 학습 데이터는 고객사 전용으로 격리합니다.

  5. 확대 적용

    운영 지표와 예외 처리 절차를 확정하고 전 라인에 적용합니다. 적용 후 3개월 동안 주간 리포트를 제공합니다.

표본 검증 신청 : contact@example.com · 02-0000-0000

링크허브의 기술을 먼저 써 보세요

Open API 신청부터 기업용 도입 상담까지 한 곳에서 진행됩니다.

도입 문의하기