Skip to content

Tellama v1.3.5 — TTFT 개선 · 모델 전환 버그 수정

Choose a tag to compare

@azossy azossy released this 25 Jul 09:03

Tellama v1.3.5

첫 답변이 나오기까지의 시간(TTFT)을 구조적으로 줄이고, 모델을 바꾼 직후 메시지가 사라지던 문제와
작은 모델이 멀쩡한 질문을 거부하던 문제를 고쳤습니다. 모든 수치는 Galaxy S10(SM-G973N, 8GB)에서
Qwen2.5 1.5B Instruct Q4_K_M 으로 직접 측정한 값입니다.

첫 답변이 빨라졌어요

이전 버전에서는 대화를 이어갈 때는 빨랐지만(0.7초), 앱을 새로 열고 첫 질문을 할 때 프롬프트 전체를
다시 처리해야 해서 오래 걸렸습니다.

상황 v1.3.4 v1.3.5
대화 중 다음 질문 683 ms 458 ms
앱을 새로 열고 첫 질문 (1,300토큰 대화) 약 28초 15.9초

어떻게 바꿨나 — 채팅 화면을 열고 사용자가 질문을 입력하는 동안, 그때까지의 대화 내용을 미리
백그라운드에서 처리해 둡니다. 전송을 누르는 순간에는 새로 입력한 문장만 처리하면 됩니다.
전송·모델 교체가 들어오면 이 작업은 즉시 자리를 비켜줍니다.

배터리와 발열도 함께 챙겼습니다. 절전 모드이거나 기기가 이미 뜨거울 때는 미리 처리하지 않고,
평소처럼 전송 시점에 처리합니다.

프롬프트가 가벼워졌어요

모델에 매번 함께 전달되던 안내문과 기억(메모리) 분량을 줄였습니다. 처리할 양이 줄어드니 첫 답변이
빨라지고 배터리 소모도 함께 줄어듭니다.

  • 기억 주입 분량 축소 (최대 4,000자 → 1,000자)
  • 언어 안내문 202자 → 57자
  • 내부 표식을 짧은 형태로 교체

멀쩡한 질문을 거부하던 문제 수정

"컴퓨터 역사에 대해 길게 써줘" 같은 평범한 요청에 I'm sorry, but I can't assist with that. 이라고
답하는 경우가 있었습니다. FAST 모드에서 모델에 전달되던 안내문 안의 특수 표기가 잘못 해석되어
대화 형식이 어긋나면서 생긴 문제였고, 해당 안내문을 제거했습니다. 안내문 없이도 FAST 모드는
그대로 동작합니다.

모델을 바꾼 직후 메시지가 사라지던 문제 수정

모델 A에서 B로 바꾼 직후에 메시지를 보내면, 답변이 오지 않거나 조용히 무시되는 경우가 있었습니다.

  • 모델 교체 중에는 전송이 교체가 끝날 때까지 기다립니다(최대 60초). 이전에는 바로 포기했습니다.
  • 답변 생성 중에는 모델 교체를 막습니다.
  • 모델이 올라오지 않은 상태를 "메모리 할당 실패"로 잘못 안내하던 것을 바로잡고, 전용 안내
    코드(RUNTIME_009)를 추가했습니다. 15개 언어 모두 반영했습니다.

발열에 대해

궁금해하실 수 있는 부분이라 실측값을 함께 남깁니다. 2분 동안 쉬지 않고 답변을 생성했을 때
배터리 온도는 32.1°C → 36.5°C 였습니다. 스마트폰이 스스로 온도를 관리하는 구간에 한참
못 미치는 값이고, 동영상을 보는 정도의 수준입니다. 다만 충전 중에 긴 대화를 하면 충전열이
더해져 손에 닿는 느낌은 더 따뜻할 수 있습니다.

설치

tellama-v1-3-5.apk 를 받아 설치하세요. 앱 안의 업데이트 기능으로도 받을 수 있습니다.