선 요약
후 사설
요약
gemma4:26B 3080 laptop 8vram이지만 공용으로 32gb 램 중에서 공용으로 15.8gb를 사용해서 약 19gb를 점유해 작동한다.
테스트 결과 콘텍스트 렌스 64k까지 아슬아슬하게 작동한다.
사설
최근 깨달은 것이 컨텐스트 렌스가 대화 내용을 검토하는 범위라는 것이다. 범위가 넓어지는 만큼 전체 내용에 대해서 하나하나 검토를 하면 각각에 대한 실패 확률이 오르기 때문에 AI에게 질문하면 최종적으로는 온전하지 못한 실패가 발생하다고 하지만 사용자 입장에서는 얼추 앞 상황에 대해서 맞줘서 가져오기 때문에 디지털 풍화와 같은 결과를 얻어서 아주 못쓸 결과는 아닌 좀 아쉬운 결과가 나오게 된다.
하지만 대게 그거면 충분하다.
지금 AI 챗 사이트의 수준과 동일하고 앞으로 거의 영원히 해결되지 않을 문제이다.
지금 테스트 해보고 있는데 워낙 램이 아슬아슬한 상태여서
웹 서칭이나 문서 작업을 하는 경우 대답을 실패하는 것을 제외하면 현재 20턴이 넘어도 잘 유지한다
애초에 기억 범위가 64k이기 때문에 6만 5천자를 넘어가면 초반 내용을 잊어가는 방식이고 내가 만들 프롬프트는 규칙이 1200자였기 때문에 20턴이 지난 다음에도 1만자가 안되었기 때문에 순수 체급으로 봐도 기억이 유지되는 것이 맞다.
B가 높은것은 전체 내용을 검토해서 얼마나 그럴듯하게 대답을 잘하는가를 결정하는 중요한 요소일것인데
gemma4:26B외에도 12B도 있으니 정말로 간단한 프롬프트 게임은 로컬로 충분히 해볼만 할것으로 보인다.
단 응답 시간은 만만하지 않는데 26B로 플레이 하니 ollam에서는 10~40초 정도 걸리지 않지만 Silly Tavern을 끼고 작동시키니 90~180초 정도 걸린다만 여기서 끝이 아니라 대답 후에도 뭔가 처리하는지 당장 메시지를 받아주지 않는다. 이 부분은 내 설정이 문제일 수도 있는데 이게 해결이 안된다면 1번의 응답을 주고 받는데 4분 정도는 상정해야한다.
