비전 벤치
벤치마크 완료. 세 모델 모두 같은 스크린샷 2장(경고 플래시 캡처 + 방어전 캡처) + 같은 프롬프트로 직접 실행했습니다.
속도 비교
┌──────────────────────────────┬──────────────┬──────────────────────┬────────────────────┬────────────┐
│ 모델 │ 워밍업(로드) │ 이미지 1 (경고 화면) │ 이미지 2 (방어전) │ 생성 속도 │
├──────────────────────────────┼──────────────┼──────────────────────┼────────────────────┼────────────┤
│ qwen3-vl:30b (MoE, 19GB) │ 25.5s │ 61.8s (1,877 tok) │ 62.2s (1,893 tok) │ 34.2 tok/s │
├──────────────────────────────┼──────────────┼──────────────────────┼────────────────────┼────────────┤
│ qwen3-vl:8b (6.1GB) │ 32.4s │ 73.0s (1,235 tok) │ 95.2s (1,628 tok) │ 19.3 tok/s │
├──────────────────────────────┼──────────────┼──────────────────────┼────────────────────┼────────────┤
│ qwen3.6:35b-a3b-nvfp4 (21GB) │ 25.6s │ 29.8s (824 tok) │ 118.9s (3,774 tok) │ 33.7 tok/s │
└──────────────────────────────┴──────────────┴──────────────────────┴────────────────────┴────────────┘
핵심: 8b가 오히려 가장 느립니다. qwen3-vl:30b는 30B-A3B MoE라 토큰당 3B만 활성화되지만, 8b는 덴스 모델이라 8B 전부 연산 → 19 tok/s로 밀립니다. qwen3.6:35b-a3b는 답이 짧으면 30초로 제일 빠르지만, 장황해질 때(3.7k 토큰 생성) 119초까지 늘어납니다.
정확도 비교 (원문 대비)
진실값: ① 터렛 1 방어 — 미니맵 표시 위치로 이동 ② ⚠ 터렛 1이(가) 공격받고 있다! 미니맵으로 이동 ③ 방어전엔 경고·펄스 마커 없음
┌─────────────────┬────────────────────────────────────────┬───────────────────────────────────┬────────────────────────────────┐
│ 모델 │ 목표 텍스트 OCR │ 경고 문구 OCR │ 마커 감지 │
├─────────────────┼────────────────────────────────────────┼───────────────────────────────────┼────────────────────────────────┤
│ qwen3-vl:30b │ 터메 1 방어… (터렛 오독) / 격파하라 │ "터메 10(7) 공격받고 있다" │ 경고 화면 ✓ / 방어전 오탐 │
│ │ (격퇴 오독) │ │ ("보인다") │
├─────────────────┼────────────────────────────────────────┼───────────────────────────────────┼────────────────────────────────┤
│ qwen3-vl:8b │ 완전 일치 / 격퇴하라 ✓ │ "터렛 10(가) 공격받고 있다!" │ 경고 ✓ / 방어전 정확히 없음 ✓ │
│ │ │ (가장 근접) │ │
├─────────────────┼────────────────────────────────────────┼───────────────────────────────────┼────────────────────────────────┤
│ qwen3.6:35b-a3b │ 표식(표시 오독) / 격퇴하라 ✓ │ "터렛 10(가) 공격받고 있다!" │ 경고 ✓ / 방어전 오탐(적 점과 │
│ │ │ 혼동) │
└─────────────────┴────────────────────────────────────────┴───────────────────────────────────┴────────────────────────────────┘
참고: qwen3.6:35b-a3b는 텍스트 모델로 예상했지만 이미지를 실제로 처리했습니다 (화면 내용을 정확히 묘사). 세 모델 모두 미니맵이 "우측
상단"임을 스스로 정정할 정도로 화면 구조 파악은 가능
결론 (화면 단위 디버깅 검증 용도)
- 원문 정확도: qwen3-vl:8b > qwen3.6:35b ≈ qwen3-vl:1"을 정확히 읽었고, 펄스 마커 오탐도 없음
- 속도: 30b(일관 62s) > 35b(짧은 답일 때만) > 8b(73–95s)
- 추천: 일관된 지연시간 + 좋은 정확도의 절충은 qwen3대로의 검증이 중요할 땐 8b (속도는 20% 정도 느림).35b는 답변 길이 변동이 커서 자동화 파이프라인엔 부적합
2장 × 1회 실행이라 표본은 적습니다. 특정 모델로 확정하시면 검증 파이프라인(/tmp/aeons-driver/vision-*.mjs) 기본 모델을 바꿔두겠습니다.