Skip to content

Broader Small Model Learning

kimjooyoon edited this page Oct 10, 2026 · 6 revisions

작은 판단 모델의 학습 범위를 넓혀 본 결과

확인: 2026-10-11 KST.

Gooo의 모델은 정해 둔 코드 조각 중 어떤 조합부터 확인할지 고릅니다. 예를 들어 input < limit의 비교 방향과 두 반환 경로를 고르면, Gooo가 실제로 그 본문을 구성해 출력 사례와 중간 조건을 확인합니다. 모델을 생략하면 고정 순서로 같은 후보를 확인합니다. 이번 작업은 이 작은 판단기를 PC에서 개선해 본 기록입니다.

이번에 바꾼 것

이전 상호작용 모델은 거리 계산 예제 8개로 학습했습니다. 이번에는 상한 선택과 거리 계산 두 종류, 한국어·영어 설명, 양수·음수 기준값을 포함한 64개로 새 모델을 한 번 학습했습니다. 모델 구조는 19,034개 FP32 가중치로 같고, 가중치 배열은 76,136B입니다. Go로 직접 학습했으며 Laya 가중치를 사용하지 않았습니다.

평가용 192개에는 학습에 없던 상수와 문장을 사용했습니다. 직접 반환과 변수 대입도 나누었고, 그중 64개는 두 모델 모두 학습하지 않은 음수 상한 규칙군입니다. 같은 틀에서 만든 변형들이므로 독립적인 업무 256개를 해결했다고 세지 않습니다. 코퍼스와 계획은 실행 전에 공개했습니다.

첫 선택은 얼마나 맞았나

한 문서의 출력 사례 8개와 중간 조건 3개를 모두 만족해야 첫 선택 성공으로 셉니다.

평가 대상 고정 순서 기존 모델 새 모델
학습한 문서 16/64 40/64 64/64
학습한 규칙군의 새 변형 32/128 72/128 117/128
학습에서 제외한 규칙군 16/64 33/64 34/64

같은 규칙군에서는 개선 49개와 회귀 4개가 있었습니다. 제외한 규칙군에서는 개선 9개와 회귀 8개가 있어 거의 제자리였습니다. 그 규칙군의 출력 사례 통과 수는 오히려 309/512에서 302/512로 줄었습니다. 중간 조건은 186/192에서 192/192로 늘었고, 두 종류를 동시에 만족한 문서는 한 개 늘었습니다. 서로 다른 지표를 함께 봐야 하는 이유입니다.

새 모델이 학습한 규칙군에서 놓친 11개는 모두 대입문 형태였습니다. 직접 반환은 한영 각각 32/32, 대입문은 한국어 27/32·영어 26/32였습니다. 다음 표현 개선에서 살펴볼 구체적인 범위가 생겼습니다. 이 평가 자료로 다시 맞춘 성적을 같은 평가의 개선으로 보고하지 않겠습니다.

세 방식 모두 최대 네 후보 안에서 작성된 요구를 만족했습니다. 같은 256개 문서를 세 번 조립한 768회이며, 임의의 모든 입력이나 실제 운영의 정확도를 뜻하지 않습니다.

비용은 어떤가

  • CPU 학습 한 번: 16.116초.
  • 새 모델 판단: 중앙값 99.125µs, p95 110.666µs, 256회.
  • 전체 실험 프로세스: 실제 시간 17.20초, CPU 시간 16.76초, 최대 RSS 58.797MiB.
  • 후보 검사: 고정 순서 640회, 기존 모델 409회, 새 모델 297회.
  • 조립 시간 합계: 각각 26.796ms / 64.856ms / 60.019ms.

모델은 후보 수를 줄였지만, 이 저렴한 산술 예제에서는 고정 순서가 더 짧게 끝났습니다. 조립 시간 합계에는 최초 자료 수집과 학습이 포함되지 않습니다. CPU 시간은 평균적으로 한 코어의 약 97.4%에 해당하며, PC 전체의 순간 사용률 증가를 측정한 값은 아닙니다. 실행 순서·호스트 부하를 통제하지 않아 속도 향상의 인과 효과는 주장하지 않습니다.

사용성과 사업 방향에 반영할 점

먼저 제공하려는 것은 작은 업무 규칙을 바꾸고, 바뀐 동작을 확인하고, 만든 프로그램을 다시 쓰는 흐름입니다. 일반 Go 함수와 테스트를 고치는 비용을 비교 기준으로 둡니다. 모델은 이득이 있는 곳에서 경로를 추천하고, 지원 범위와 실패를 결과에 남깁니다.

다음 도입에서 관측할 값은 최초 선언 작성부터 첫 실행까지의 시간, 두 번째 규칙 변경에 드는 수고, 빠뜨린 사례, 반복 사용, 지원 비용입니다. 실제 사용자의 유료 요청과 절감액은 아직 없습니다. 작은 업무 도입 계획에 제품과 수익 가설을 정리했습니다.

타입이 정해진 응답, 작성한 요구 만족, 실제 업무의 올바른 처리는 각각 확인할 범위가 다릅니다. 이번 결과는 가운데 범위에 대한 관측입니다. 투자·계약·인수의 시점이나 가능성을 이 실험 성적으로 환산하지 않습니다.

공개 코드와 지원 범위

SDK PR56에 소스·가중치·실패·시간 기록과 검산기를 공개했습니다. 고정된 결과와 읽는 방법. 검산기는 저장된 자료만 읽고, 학습과 판단을 다시 실행하지 않습니다. 로컬 전체 SDK 검사와 기록 검산 race 검사를 통과했습니다. 원래 push·PR CI도 통과해 SDK main의 de95d555에 병합했고, 병합된 소스의 원래 CI38079023648도 통과했습니다. 새 릴리스 태그는 만들지 않았습니다.

이번 새 가중치의 네이티브 CLI 도입은 아직 관측하지 않았습니다. 공개 Gooo0.6.27은 SDK0.2.37을 사용합니다. SDK0.2.39의 두 모델을 같은 소스·사례로 선택하고 네이티브 조립·저장 재실행에 연결하는 컴파일러 PR1450을 공개했습니다. 로컬 전체 검사와 추가 병합 후 CLI race 검사를 통과했습니다. 원래 PR의 핵심 CI·준비 검사와 독립 호환성 검사를 통과하고 증거 파일을 확인해 dev의 c8a68c51에 병합했습니다. 병합된 소스의 원래 준비 검사는 통과했고, 핵심·호환성 검사는 진행 중입니다. 새 모델의 Hugging Face 업로드는 인증 대기 중이며 GitHub 원본은 공개돼 있습니다.

후속 소스 입력 정리는 직접 반환·대입문 96쌍 모두를 같은 배열로 읽도록 했습니다. 기존 관측을 다시 학습하거나 실행하지 않고 저장된 소스를 점검한 결과이며, 이 문서의 모델 성적은 그대로 유지됩니다.

별도 문서로 진행한 사례와 반례 실험에서는 새 입력의 첫 선택 이득이 작았고, 반례를 소스에 추가하면 고정 순서도 같은 최종 검사 결과에 도달했습니다.

Gooo

배우기

직접 다뤄 보기

원리와 개발

공개 코드와 모델

Clone this wiki locally