보안 규정상 문서를 회사 밖으로 한 장도 보낼 수 없는 회사가 있어요. 그런 경우 학습은 사내 PC·서버에서 하고, 결과로 나온 전용 학습 결과(어댑터) 파일만 올리면 돼요. 판정력은 Tunia의 대형 기본 모델이 맡아요. 올린 모델은 클라우드에서 구운 모델과 똑같이 API·플레이그라운드에서 바로 써요.
올릴 때 서버가 파일 구조를 검사해요 — 정해진 모양의 숫자 배열만 받고, 실행 가능한 코드가 섞인 파일은 거절해요.
폐쇄망이면 인터넷이 되는 PC에서 1단계만 하고 폴더째 옮기면 돼요. 그 뒤로는 인터넷이 필요 없고, 마지막 올리기만 tunia.ai 로 HTTPS 한 번이면 끝이에요(파일을 USB로 옮겨 콘솔에서 올려도 돼요).
키트(파이썬 스크립트 3개)와 기본 모델 번들(Tunia가 미리 학습해 둔 범용 문서 보안 모델 · 약 33MB)을 받아요. 번들은 귀사 이름으로 발급되고, 귀사 전용 모델을 만드는 데만 쓸 수 있어요.
unzip tunia-onprem-kit.zip && cd tunia-onprem-kit python -m venv .venv && source .venv/bin/activate pip install -r requirements.txt # GPU면 torch는 CUDA 판으로 python tunia_onprem.py init --api-key sk_bsp_… # 번들 + 언어 인코더(1.1GB · 공개 모델) 내려받기
회사 문서 폴더를 지정하면 텍스트만 뽑아 한 파일로 모아요. 이 파일은 회사 안에만 두세요. 워드(docx)·파워포인트(pptx)·엑셀(xlsx)·한글(hwpx)·PDF·txt·md·html 을 읽어요. 구형 HWP·DOC 는 사내 프로그램에서 HWPX·DOCX·PDF로 저장한 뒤 넣어 주세요.
python tunia_onprem.py parse ./우리문서폴더 # → data/train.jsonl python tunia_onprem.py parse ./시험문제지폴더 --test # (선택) 채점 전용 문서
클라우드 학습과 같은 기준이에요 — 20건부터 되고 200~2,000건이 가장 좋아요. 공개·내부·기밀·극비를 골고루 넣어야 경계를 배워요.
기본은 어디에도 문서를 보내지 않는 모드예요. 라벨은 기본 모델의 판정과 문서 안 표기(「대외비」 등)로 만들어요. 사내에 LLM 서버(vLLM·Ollama 등 OpenAI 호환)가 있으면 라벨 검수에 붙일 수 있어요 — 정확도가 더 좋아져요.
python tunia_onprem.py train # GPU 있으면 5~10분 python tunia_onprem.py train --device cpu # GPU 없을 때 python tunia_onprem.py train --teacher openai \ --teacher-base-url http://10.0.0.5:8000/v1 --teacher-model Qwen3-32B # 사내 LLM 검수
클라우드와 같은 안전장치가 들어 있어요 — 학습에 안 쓴 문서로 채점하는 성적표, 일반 문서 판정력이 무너지지 않게 지키는 균형 데이터와 회귀 게이트.
학습 결과에서 올릴 것만 골라 zip 하나로 묶어요. 성적표에서 파일 이름이 든 문서별 판정은 기본으로 빠져요 (콘솔에서 보고 싶으면 --include-detail).
python tunia_onprem.py pack # → runs/<날짜>/tunia_model.zip
zip을 올리면 서버가 구조를 검사하고 새 버전으로 등록해요. 그 다음은 클라우드 모델과 똑같아요 — 모델 평가에서 성적표를 보고, 테스트하고, API로 호출해요.
python tunia_onprem.py upload --activate # 올리고 바로 기본 버전으로 # 또는 API로: curl -X POST https://tunia.ai/v1/dlp/models/import \ -H "Authorization: Bearer sk_bsp_…" -F package=@tunia_model.zip -F activate=1
없어요. 이 모델은 문장을 만들지 못하는 분류 전용이고, 올라가는 것은 그중에서도 기본 모델 위에 얹는 작은 조각(어댑터)의 숫자 배열이에요. 어떤 입력을 넣어도 출력은 「공개~특급 중 하나」뿐이에요.
같은 학습 코드·같은 기본 모델이에요. 한 가지 차이는 라벨 검수예요 — 클라우드는 전문가 모델이 저신뢰 문서를 검수하지만, 사내 학습의 기본 모드는 문서를 밖으로 안 보내려고 검수를 생략해요. 사내 LLM 서버를 붙이면 그 차이도 없어져요.
모델 올리기는 무료예요(학습은 귀사 장비에서 하니까요). 판정 API 호출은 클라우드 모델과 같이 건당 30원이에요.
귀사 전용 모델을 만드는 용도로만 써 주세요 — 번들 안 LICENSE.txt 에 그대로 적혀 있어요. 다른 회사에 건네거나 다른 서비스에서 서빙하는 건 안 돼요.