Skip to content

Tellama v1.3.6 — TTFT 안정화 · 모델 전환·슬래시 명령 수정

Latest

Choose a tag to compare

@azossy azossy released this 25 Jul 11:11

Tellama v1.3.6

첫 답변까지 걸리는 시간을 안정적으로 줄이고, 모델을 바꾼 직후 메시지가 사라지던 문제와
슬래시 명령이 엉뚱하게 동작하던 문제를 고쳤습니다. 모든 수치는 Galaxy S10(SM-G973N, 8GB)에서
Qwen2.5 1.5B Instruct Q4_K_M 으로 직접 측정한 값입니다.

첫 답변이 빨라졌고, 무엇보다 일정해졌습니다

새 대화에서 다섯 번 연속 질문했을 때의 실측값입니다.

질문 첫 답변 준비 생성 속도
1번째 (앱 켜고 처음) 1.6초 11.3 tok/s
2번째 1.8초 12.6 tok/s
3번째 0.3초 8.0 tok/s
4번째 3.1초 10.6 tok/s
5번째 0.3초 7.6 tok/s

v1.3.4에서 앱을 켜고 첫 질문할 때 7.4초가 걸렸던 구간이 1.6초가 되었고, 간헐적으로
6~8초씩 튀던 현상이 없어졌습니다.

무엇을 고쳤나 — 두 가지입니다. 하나는 이전 대화 내용을 캐시에서 부분적으로 지우는 작업이
이 기기에서 약 6초나 걸린다는 것을 실측으로 확인해, 짧은 대화에서는 캐시를 전부 비우고 다시
채우도록 바꿨습니다(4배 빠릅니다). 다른 하나는 v1.3.5에서 넣은 "미리 준비" 기능이 오히려
생성과 CPU를 다투어 느려지게 만든다는 것을 확인해 기본적으로 끈 것입니다. 프롬프트를 이미
충분히 줄여 둔 덕에 이 기능 없이도 빠릅니다.

모델을 바꾼 직후 메시지가 사라지던 문제 수정

모델 A에서 B로 바꾼 다음 바로 질문을 보내면 답이 오지 않는 경우가 있었습니다. 모델이 준비를
마쳤다고 표시된 뒤에도 내부 기록 작업이 잠깐 더 남아 있었고, 그 사이 도착한 메시지가 조용히
거부됐습니다. 이제 준비가 끝날 때까지 기다린 뒤 정상적으로 답변합니다.

슬래시 명령이 제대로 동작합니다

/clear 를 입력하고 전송하면 명령이 실행되지 않고 모델에게 그대로 전달되어, 모델이
"대화를 지웠습니다" 같은 사실과 다른 답을 만들어 냈습니다. 이제 /clear, /new,
/model, /memory, /export, /help 를 입력해 전송하면 바로 실행됩니다.

새 대화가 더 깨끗해졌습니다

새 대화를 시작하면 이전 대화의 캐시를 확실히 비웁니다. 이전에는 남아 있던 캐시 때문에 새
대화의 첫 답변이 느려질 수 있었습니다.

설치

tellama-v1-3-6.apk 를 받아 설치하세요. 앱 안의 업데이트 기능으로도 받을 수 있습니다.