서버 현황:
| 항목 | 스펙 |
|---|---|
| CPU | 8코어 / 2.0GHz (가상머신) |
| RAM | 22GB (여유 15GB) |
| Disk | 131GB 여유 |
| GPU | 없음 (CUDA 없음) |
GPU가 없어서 생기는 제약:
- CPU만으로 추론 → 모델 크기에 따라 매우 느림
- 7B 이상 LLM은 응답 1건에 수십 초~수 분 소요
- Stable Diffusion 같은 이미지 생성은 사실상 불가 (몇 시간)
현실적으로 가능한 옵션:
| 방식 | 모델 예시 | 속도 |
|---|---|---|
transformers 소형 모델 |
distilbert, MiniLM, small-T5 | 빠름 |
ollama 경량 LLM |
gemma2:2b, llama3.2:3b | 보통 |
ollama 양자화 LLM |
mistral 7B Q4 | 느림 |
| 임베딩/분류 모델 | sentence-transformers | 빠름 |