뭐이리 복잡한지... 몇일을 걸린건지 모르겠다정말 세팅이 8할은 차지하는거 같다.https://github.com/AILab-CVC/YOLO-World?tab=readme-ov-file GitHub - AILab-CVC/YOLO-World: [CVPR 2024] Real-Time Open-Vocabulary Object Detection[CVPR 2024] Real-Time Open-Vocabulary Object Detection - AILab-CVC/YOLO-Worldgithub.com다음 세팅이 필수다 이거 버전이 하나라도 틀리면 애를 정말 많이 먹는다... torch 1.11은 언제적 버전인지.. 일단 내 환경은 python3.9 , cuda 12.4 이런 환경이였다. 1. python 가상환..
전체 글
객체 인식 (object recognition)과 추적(object traking)은 컴퓨터 비전의 핵심 기술, 물체를 식별하고, 위치를 파악하여 연속 프레임에서 이동 경로를 추적하는 과정▶︎ Object Traking비디오 영상에서 시간에 따라 움직이는 어떤 물체 또는 여러개의 물체의 위치를 찾는 과정여기서 출력은 Traker가 되는데 , 각 Traker은 각 비디오 frame에서의 객체 정보를 가지고 있다.Multiple Object Traking → bounding box를 통해 여러 객체 추적Visual Object Traking → 하나의 객체만 추적▶︎ MOT여러가지 객체를 트래킹 하는것여러객체를 동시에 처리 할 수 있어야함단기간의 시간이 아닌 장기간 트래킹이 가능해야함주요 과제ID 전환프레임..
1. 프로젝트 정의 QR 태그를 1차적으로 읽고, QR이 손상된 경우 상단의 문자 영역을 OCR을 이용해서 읽고 파싱하는 프로젝트기본 paddleOCR의 문서 방향 회전 모델은, 프로젝트 데이터를 올바르게 회전 시키지 못하는 문제 발생-> 프로젝트 데이터에 맞는 파인튜닝 필요 2. use_doc_orientation_classify 파인튜닝- 환경 설정 방법python: 3.9/3.10/3.11/3.12/3.13 (가상환경 세팅 필요) 1. PaddlePaddle 설치Paddle Paddle 설치 버전 확인 Run the following command to install www.paddlepaddle.org.cn해당 페이지에서 운영체제 맞게 설치하면된다. gpu가 있는 경우 CUD..
1. OCR 개요1.1 OCR(Optical Character Recognition)이란?OCR은 이미지에서 텍스트를 추출하는 기술로 문서,사진,스캔본 등의 이미지에서 문자를 인식하여 컴퓨터가 편집 가능한 텍스트 데이터로 변환하는 과정을 말합니다. OCR의 주요 응용분야- 문서 디지털화 - 자동 번호판 인식- 영수증 및 청구서 처리 1.2 OCR 파이프 라인 구성요소일반적인 OCR 시스템은 다음과 같은 단계로 구성됩니다. (1) 이미지 전처리 - 노이즈 제거, 회전보정, 크기 조정 등 (2) 텍스트 영역 검출 - 이미지에서 텍스트가 있는 영역 찾기 (3) 텍스트 인식 - 검출된 영역의 텍스트를 문자열로 반환 (4) 후처리 - 인식 결과 개선 및 정제 1.3 주요 OCR 라이브러리 Tessera..
오랜만에 다시 공부하는 파이썬이라.. 하나도 기억이 안난다 🥲 문제설명영어 알파벳으로 이루어진 문자열 str이 주어집니다. 각 알파벳을 대문자는 소문자로 소문자는 대문자로 변환해서 출력하는 코드를 작성해 보세요. 입출력 예입출력 예입력 #1aBcDeFg출력 #1AbCdEfG 내 풀이upper(),lower()밖에 생각이 나지 않아서 if문으로 풀었다str = input()for i in str: if i.islower(): print(i.upper(),end='') else: print(i.lower(),end='') 다른 풀이str = input()print(str.swapcase()) 파이썬은 없는게 없는거같다. swapcase()를 사용하면, 대문자는 소문자..
1. 대소문 변환- str.upper(): 모든 문자 대문자 변환- str.lower(): 모든 문자 소문자 변환- str.captialize(): 첫 글자만 대문자, 나머지 소문자-str. title(): 각 단어의 첫글자를 대문자 변환-str.swapcase(): 대->소, 소->대s = "hello world"print(s.upper()) # HELLO WORLDprint(s.capitalize()) # Hello worldprint(s.title()) # Hello World 2.문자열 검사- str.isalpha(): 모든 문자가 알파벳인지 확인- str.isdigit(): 모든 문자사 숫자인지 확인- str.isalnum(): 모든 문자가 알파벳 또는 숫자인지 확인..
1. COCO Keypoints Dataset*COCO (Common Objects in Context)**는 인간의 17개의 주요 keypoint를 제공하는 데이터셋으로, 인체의 자세를 분석하는 데 널리 사용되고있으며, 80개의 classes 존재한다.Keypoint 구성:총 17개의 keypoint로 구성머리: 코, 왼쪽 눈, 오른쪽 눈, 왼쪽 귀, 오른쪽 귀상체: 어깨(좌/우), 팔꿈치(좌/우), 손목(좌/우)하체: 엉덩이(좌/우), 무릎(좌/우), 발목(좌/우)장점:대규모 데이터셋으로 잘 정제되어 있어 높은 신뢰성다양한 오픈소스 모델 지원 (예: OpenPose, Detectron2)단점:COCO는 군중 데이터가 많아 다중 인식에서 유리하지만 단일 자세 분석에는 과적합 위험있음coco datase..
2주차에는, 데이터 정리와 keypoint 추출을 위한 코드 작성을 진행하였다. 1. 데이터 정리positive(쓰러진 사진) 880장을 추출하였으며, 해당 사진에서는 1명의 사람만 등장한다.neagtive(서있는 사진) negative사진으로는 upright 자세인 사진만 사용하였다.해당 사진에는 사람 여러명이 포함되어있다. 2, 키포인트 추출 human pose estimation은 크게 두가지 방식으로 접근할 수 있는데, 첫번째는 Top-down방식이고, 두번째는 Bottom-up 방식이다. 1) Top-down methodhuman detection을 먼저 수행하고, 주어진 human bounding box 내부에서 pose estimation을 수행하는 two stages 방식을 사용한다.장..
먼저 쓰러짐을 감지하기 위해 필요한 것은 무엇일까? 바로 쓰러진 사람의 Keypoint값들이다. 이를 위해 1주차에는 Fall Dataset을 조사하였다. 1. Fall Detection Dataset_le2i집,커피룸,사무실,강의실 네 곳에서 쓰러진 동영상 제공, 형식 320*240 25FPS 고품질데이터이다.https://www.kaggle.com/datasets/tuyenldvn/falldataset-imvia Le2i Fall Dataset www.kaggle.com누가 친절하게 kaggle에 데이터 셋을 올려두었다 참고해보자. 우리 프로젝트는 실시간 쓰러짐 인식 연구여서, 동영상으로 학습 시킬 필요가 없었다.해당 데이터셋의 동영상 파일은, 모두 쓰러지고 끝나는 동영상이라쓰러진 사진만 추출하기 위..
1. 프로젝트 개요 SKHU VENTURE는 2024-1학기 인공지능 캡스톤 디자인 수업의 일환으로 진행된 프로젝트입니다. 본 프로젝트는 예비 학생 및 국제학부 신입생들의 원활한 학교생활 적응을 돕기 위한 캠퍼스 탐방 어플리케이션을 제공니다. 특히, 프로젝트의 인공지능 개발 부문은 학사 논문으로 발전되어 관련 학술지에 투고되는 성과를 이루었습니다.https://github.com/SKHU-Adventure SKHU VENTURESKHU VENTURE has 4 repositories available. Follow their code on GitHub.github.com2. 프로젝트 진행 과정 프로젝트는 2024년 3월부터 교내 경진대회가 개최된 10월까지 약 8개월간 진행되었습니다. 효율적인 프로젝트..
작년 겨울방학에 이어, 2024년 겨울방학에도, 학교 학부생 인턴 활동을 진행하게 되었다.작년에는 개인팀으로 여러 팀이 진행되었는데, 이번 연구는 8명이 한팀을 이뤄 한 주제에 대해 공부하는 활동이였기 때문에,관심을 가지고 지원하게 되었다. 주제는 CCTV 영상 기반 작업자 위험사항 실시간 모니터링 기술 개발 및 실증으로, 추후 논문과 학술대회까지 참가하는 프로젝트이다. 해당 프로젝트에서 파트가 크게 4가지로 나뉘는데1. PM2. Person Detection& Pose Estimation3. Fall detection4. Multiple Object Tracking5.DashBoard 해당 파트에서 난 Fall Detection을 맡았다.쓰러짐을 학습시켜야한다는 내용이 흥미롭기도 했고, 그냥 재미있..
6.1.2 Stepwise Selection best subset selection은 변수의 수(p)가 매우 클 때는 적용하기 어렵다. 또한 , 변수의 수가 클때는 통계적 문제가 발생할 수 있다.이런 문제점의 대안으로 stepwise 방법이 있다.(1) Forward Stepwise Selection Forward Stepwise Selection은 변수 선택 방법 중 하나로, 빈 모델에서 시작하여 한 번에 하나씩 변수를 추가해나가는 방식이다. 이는 모든 가능한 변수 조합을 고려하는 Best Subset Selection의 계산적으로 효율적인 대안으로 개발되었습니다 forward stepwise selection 알고리즘(1) Null Model M0에서 시작(2) k = 0,1,2... , p-1까지..