1. 들어가며
안녕하세요, <마법 공방의 대장장이> PO 유동현입니다.
저희 게임은 AI 를 활용해서 유저의 드로잉을 실제 게임 속 무기로 만들어지는 게임이에요.
꽤 실험적인 도전이라, PoC(개념 증명, Proof of Concept) 단계를 가지고 진행하고 있어요.
현재까지 게임의 핵심 아이디어가 기술적으로 구현 가능한지를 판단하기 위해 PoC를 진행했어요.
이 글에서는 어떤 기술 후보를 검토했고, 어떤 기준으로 선택했으며, 어떤 결과가 나왔는지 공유해요.
비슷한 고민을 하는 팀에 의사결정 과정의 레퍼런스가 되길 바라요.
2. 이번 목표
게임의 핵심 기능인 AI 시스템이 실제로 동작 가능한지 PoC로 검증하는 것이 이번 주 목표였어요.
본격 개발에 들어가기 전, 후보 기술을 비교해서 가장 적합한 방향을 결정하는 단계예요.
저희가 검증하고자 정의했던 문제는 다음과 같아요.
- 유저의 상호작용을 AI가 분석한 결과를 게임 속 무기 구조로 재설계가 가능한가?
- 어떤 구조로 입력을 받고 결과를 제공해야 하는가?
- AI 모델의 예상 비용은 어느 정도인가?
- On-Device 모델을 사용한다면, PC/Mobile 환경에서 충분히 사용 가능한 성능이 나오는가?
3. 실제로 한 것
A. 상황 분석
당시 저희의 무기 제작 플로우는 다음과 같았어요

저희는 해당 플로우를 A.이미지 분석 단계, B.원소 조합 단계, C.무기 생성 단계로 구분하여 조합했어요.
그리고 각 단계별로 PoC를 실시하기로 했습니다.



B. 문제 정의 및 가설 설정
저희는 우선 위에서 정의한 문제 중 2번(어떤 구조로 입력을 받고 결과를 제공해야 하는가?)을 우선 해결 문제로 선정하고, 이를 해결하기 위해 무기 제작 단계 별로 2개의 시나리오를 준비했습니다.
- A.이미지 분석 단계
- VLM(Vision Language Model, 이미지를 이해하고 텍스트로 설명하는 AI 모델) 기반 접근 방식
- OpenCV(이미지 처리에 특화된 오픈소스 라이브러리) 활용 기반 LLM 접근 방식
- B.원소 조합 단계 & C.무기 생성 단계
- Description이 없는 방식
- Description을 추가한 방식
그리고 부가적으로 3번(AI 모델의 예상 비용은 어느 정도인가?), 4번(On-Device 모델을 사용한다면, PC/Mobile 환경에서 충분히 사용 가능한 성능이 나오는가?)의 해결을 위해 상용 모델과 On-Device 모델을 구분하여 분석을 했어요.
또한 상용 모델에 대해서는 예상 토큰 사용량 분석과 예상 일일 활성 사용자수 (DAU)를 예측해, 예상 비용을 계산해봤어요.
벤치마킹 결과는 아래 표의 기준으로 삼았어요.
| 분류 | 항목 | 측정 공식 | 단위 |
| 품질 | 정확도 | (정상 파싱된 데이터 수 / 전체 테스트 수) * 100 | % |
| 포맷 준수율 | (정해진 JSON 스키마를 100% 만족하는 횟수 / 전체 테스트 수) * 100 | % | |
| 운영 | 토큰 비용 | (입력 토큰 * 단가) + (출력 토큰 * 단가) | $ |
| 기술 | 리소스 점유량 | 테스트 중 Peak RSS(Resident Set Size)의 평균 | MB |
| 성능 | 추론 속도 | 총 생성 토큰 수 / 총 소요 시간 | TPS |
C. 실험 및 결과
저희는 On-Device 모델에 대해서는 LLama.cpp 과 Unity Sentis를, 상용 모델에 대해서는 gpt와 gemini를 사용해서 실험을 수행했어요.
우선 On-Device 모델에 대해서는 결과가 다음과 같아요.


저희는 해당 결과를 이렇게 해석했어요.
- 정확도가 목표치에 미치지 못한 케이스가 일부 존재
- Unity Sentis는 현재 충분한 성능이 나오지 않음.
- LLama.cpp에서는 충분한 성능이 나오는 몇몇 모델을 제외하고, 나머지는 아쉬운 성능을 보임.
다음은 상용 모델에 대한 DAU/MAU 분석 및 토큰 사용량 분석 결과에요.


D. 정리
이번 PoC 과정에서 마주한 한계점은 다음과 같아요.
우선 On-Device 모델은 아직 충분한 성능을 내기에는 아직 모자란 점이 많다는 점입니다.
물론 특정 모델과 충분히 높은 사양의 pc에서는 어느정도의 성능이 나오긴 하지만, 아직 상용 모델에 비해서는 사용하기 어려울 정도로 떨어지는 것을 이번 분석을 통해 알게 되었어요.
그러한 디메리트에도 무료로 사용 가능함이 On-Device 모델에 큰 장점이라고 생각해요.
상용 모델에서는 이번 분석을 통해 현재 시나리오에서의 예상 토큰 사용량을 알았고, AI 아키텍쳐 설계에 참고할 예정이에요.
그래서 다음에는 아래와 같은 태스크를 수행해볼 계획이에요.
- 선정된 기술로 프로토타입 구현 착수
- 정확도 보완을 위한 전처리 파이프라인 설계
- TPS 목표치 달성 여부 재측정
4. 마치며
이번 PoC는 단순히 "어떤 기술이 더 좋은가"를 가리는 작업이 아니라, 우리가 만들고 싶은 게임이 기술적으로 어디까지 실현 가능한지를 가늠해 보는 과정이었어요.
짧은 기간이었지만 후보 기술의 한계와 가능성을 직접 손으로 확인할 수 있었고, 덕분에 다음 단계를 자신 있게 그릴 수 있게 됐어요.
다음 주부터는 이번 결과를 바탕으로 프로토타입 작업에 들어가요.
비슷한 고민을 하는 팀이 있다면 이 기록이 작은 참고가 되길 바라요.

'Project > 마법 공방의 대장장이' 카테고리의 다른 글
| 게임 기획 문서를 Mintlify로 옮긴 이유 - Markdown·Front Matter·Git으로 AI와 협업하기 | 마법 공방의 대장장이 #02 (0) | 2026.09.27 |
|---|