LLM 업무 목록과 역할·책임
이 문서는 A2A를 제외한 제품 LLM 업무를 87개 관리 단위로 정리한 목록이다. 각 항목은 단순한 세부 작업이 아니라 한 명의 최종 책임자가 산출물과 완료 기준을 판정할 수 있는 업무 묶음이다. 구현 단계에서는 필요에 따라 하위 개발·시험 항목으로 나눌 수 있지만, 계획과 보고는 이 목록의 단위로 관리한다.
각 표에는 수행 책임, 최종 책임, 산출물·완료 기준을 표시했다. 역할별 상세
협업 구조는 LLM 업무 역할·책임 문서에서
확인할 수 있다.
그림은 11개 업무군을 요구·데이터·학습·평가·통합·출시·관찰의 한 생애주기로 연결한다. 파트너 PoC와 해외 적용도 별도 시연이 아니라 같은 품질·비용·보안·운영 판정 흐름 안에서 관리한다.
1. 업무를 나누고 합친 기준
| 판단 | 기준 |
|---|---|
| 별도 업무로 유지 | 최종 책임자, 승인 기준, 핵심 산출물, 배포 시점 중 하나 이상이 독립적임 |
| 하나로 통합 | 같은 담당자가 같은 변경 묶음으로 구현하고 동일한 시험·승인을 거쳐야 완료됨 |
| 하위 작업으로 관리 | 독립 결과라기보다 상위 업무를 완료하기 위한 구현 절차나 점검 항목임 |
| 기능군으로 묶어 관리 | 청정·이동·설정처럼 기능은 여러 개지만 동일한 유지보수 생애주기와 회귀 기준을 공유함 |
순번은 문서 안에서만 사용하는 1~87 인덱스이며 도메인, 우선순위, 조직 소유권을
뜻하지 않는다. 설명은 한글을 우선하되 AudioRecord, Binder, QNN, WER/CER,
SK_xx처럼 코드·규격·지표와 직접 대응하는 고유 명칭은 원문을 유지한다.
2. 제품·기능 개발 생애주기
사용자 문제를 제품 기능으로 정의하고, 지원 범위부터 오류·종료 정책과 출시 기준까지 합의하는 업무다. 기능별 세부 사양은 이 단계에서 먼저 고정한 뒤 프롬프트, 앱, 기기 제어와 시험 업무로 전달한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 1 | 사용자 문제·성과지표·대표 발화 정의 | PO, PDE | PO | 사용자 시나리오, 대표·경계 발화, 측정 지표 |
| 2 | 지원 범위와 의도·행동 분류 정의 | PO, PDE, ODA | PO | 지원·부분지원·미지원 범위, 의도·행동 분류표 |
| 3 | 입력값·기본값·누락 정보·멀티턴 정책 정의 | PO, PDE | PO | 입력 계약, 기본값, 추가 질문과 문맥 유지 정책 |
| 4 | 실행 전제조건·금지조건·종료·오류 정책 정의 | ODA, DVI, UX | PO | 상태 조건표, 성공·취소·실패·시간 초과 기준 |
| 5 | 음성·자막·화면 안내 설계 | UX, PDE | PO | TTS·자막·화면 문구, 진행·실패 피드백 기준 |
| 6 | 국가·언어·고객·제품 모드별 변형 관리 | PDE, CLD, PO | PO | 지역·언어·B2B/B2C 차이표와 공통 기준 |
| 7 | 기능 검수·변경·폐기·호환성 관리 | QA, PO, ODA | PO | 인수 기준, 회귀 범위, 전환·폐기 계획 |
3. 온디바이스 에이전트 핵심 실행부
사용자 음성이 입력된 뒤 STT, 로컬·클라우드 LLM, 기기 API와 TTS로 이어지는 Android 실행 경로를 관리한다. 세부 메서드보다 음성 세션, 실행 상태, 오류 복구와 앱 생애주기가 하나의 안정적인 흐름으로 끝나는지를 기준으로 묶었다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 8 | 음성 세션 시작·종료·취소와 발화 끝점 관리 | STT, ODA | ODA | 웨이크업, F1/F2/F3, VAD, 무음·짧은 발화 상태 전이 시험 |
| 9 | 오디오 입력 소유권과 PCM 콜백 관리 | STT, ODA | STT | AudioRecord 소유권, 버퍼 반환, 동시 접근 계약 |
| 10 | STT 모델 실행·언어 선택·재시작 관리 | STT, ODA | STT | 모델 초기화·해제·대체 경로·재시작 시험 |
| 11 | STT 전처리·정규화·원문 추적 관리 | STT, PDE | STT | 원문·가공문 출처, 치환·정규화 규칙과 회귀셋 |
| 12 | 사전 매칭과 충돌 방지 관리 | PDE, ODA | PDE | 완전·부분·토큰·복수 키워드 규칙, 오탐 방지 시험 |
| 13 | 로컬 LLM 추론과 대화 문맥 관리 | ODA, PDE | ODA | 로컬 프롬프트, 대화 이력, 추론 호출 계약 |
| 14 | Genie/JNI 등 네이티브 실행부 생애주기 관리 | ODA | ODA | 초기화·해제·오류 복구·반복 실행 증거 |
| 15 | 클라우드 LLM 인증·호출·재시도·대체 경로 관리 | ODA, CLD | CLD | 인증, 시간 초과, 재시도, 5xx·연결 실패 대응 |
| 16 | LLM 응답 해석·재질의·멀티턴 상태 관리 | ODA, PDE | PDE | Case 응답, rewrite_query, 상태 저장·재개 시험 |
| 17 | 기기 API 검증·실행·결과 통지·오류 연결 | ODA, DVI | DVI | 토큰-API 연결표, 입력 검증, 결과·오류 매핑 |
| 18 | TTS 정규화·대기열·취소·대기 상태 수렴 | ODA, UX | ODA | 중복 방지, 재생 종료, 취소, 화면·음성 상태 시험 |
| 19 | Android 서비스·동시성·메모리 안정성 관리 | ODA | ODA | ForegroundService, Binder, coroutine, executor 장시간 시험 |
| 20 | 시스템 앱 배포본·플랫폼 서명·부팅·복구 검증 | ODA, REL | REL | 인증서 일치, 시스템 영역 배치, 부팅·되돌리기 증거 |
4. 기기 기능군 유지보수
기존 기기 기능을 음성 명령과 연결하고 제품 변경 뒤에도 정상 동작하도록 관리한다. 기능별 메서드를 각각 별도 업무로 세지 않고, 같은 담당자와 회귀 기준을 공유하는 기능군 단위로 묶었다.
| 순번 | 기능군 | 대표 범위 | 수행 책임 | 최종 책임 | 주요 완료 기준 |
|---|---|---|---|---|---|
| 21 | 청정·이동 | 고정·이동·선택공간 청정, 이동, 스테이션 복귀, AI 스캐닝 | ODA, DVI | DVI | 위치·청정 상태, 중단·복귀, 공간명, 오류 처리 |
| 22 | 기본 설정 | 풍량, 밝기, 음량, 음소거, 언어, 음성 성별, 온도 단위 | ODA, UX | PO | 조회·설정 범위, 중복 요청, 사용자 안내 |
| 23 | 환경·공기질 | 공기질 표시, 공간별 공기질, 센서 민감도, 날씨·환경 정보 | ODA, DVI, CLD | PO | 최신성, 단위, 센서 누락과 대체 응답 |
| 24 | 화면·알림 | 대기화면, 공간 카드, 알림함, Launcher 화면 전환 | ODA, UX | UX | 화면 전환·복귀, 테마 호환, 알림 표시 |
| 25 | 스케줄·생활 모드 | 일반·청정 스케줄, 상호작용, 나이트, 올타임 | ODA, DVI | PO | 등록·조회·변경·해제, 중복·시간 정책 |
| 26 | 보안·프라이버시 | 홈 잠금, 프라이버시, Security/Safe Care, UV LED | ODA, DVI | PO | 권한, 모드 전환, 사용자 동의와 해제 |
| 27 | 제품 설명·도움말 | 기능 설명, 요금, 장점, 사용·미지원 안내 | PDE, CLD | PO | 제어 발화와 설명 발화 구분, 근거 응답 |
| 28 | 공통 상태·오류 | 저전력, 이동 불가, 네트워크, 비상 상태, 앱 상태 | ODA, DVI | DVI | 오류군, 상태 초기화, 사용자 안내, 복구 경로 |
FunctionCallHandler의 SK_xx 분기는 기능 호출 진입점이다. 기능 변경 시에는 토큰만
확인하지 않고 상태, 오류, TTS, 화면, 다국어와 실기기 동작을 하나의 회귀 묶음으로
검증한다.
5. 데이터 생애주기
학습과 평가에 사용하는 음성, 문장, 정답과 기기 실행 결과를 수집부터 폐기까지 관리한다. 라벨 하나를 만드는 절차보다 데이터 묶음의 목적·품질·분할·버전을 다시 재현할 수 있는지가 완료 기준이다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 29 | 데이터 수집 목적·동의·범위·보존 정책 관리 | DATA, PO, SEC | SEC | 수집 명세, 동의·보존·삭제 기준 |
| 30 | 개인정보 제거·가명처리·접근 통제 | DATA, SEC | SEC | 비식별 처리 절차와 접근 권한 증거 |
| 31 | STT 전사문 교정과 발화 품질 관리 | DATA, STT | STT | 교정 전사문, 음질·붕괴·환경 라벨 |
| 32 | 제품 정답 라벨과 모호·복수정답 정책 관리 | DATA, PDE, QA | PO | Case·토큰·입력값·응답 정답, 라벨 정책 버전 |
| 33 | 학습·검증·시험 분할과 경계 사례 구성 | DATA, MLE, QA | QA | 누수 없는 분할표, 어려운 부정 예시, 국가·환경 균형 |
| 34 | 데이터셋 버전·출처·라이선스·변경 이력 관리 | DATA, REL | DATA | 데이터 관리 대장, 데이터 설명서, 변경 추적 |
6. 모델 개발·학습
제품 요구에 맞는 STT, LLM, 화자 인식과 TTS 모델을 선정하고 학습·변환·최적화한다. 정확도만이 아니라 기기 실행 가능성, 지연, 메모리, 전력과 실행 환경 호환성을 함께 판정한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 35 | 제품 목표를 모델 지표·자원 한도로 변환하고 기준선 고정 | MLE, PO, STT | PO | 모델 요구 명세, 기준 모델·성능표 |
| 36 | 후보 모델·라이선스·언어·실행 환경 적합성 조사 | MLE, SEC, ODA | MLE | 후보 비교표와 도입 판단 |
| 37 | 학습 데이터 정제·증강·추출 비율 설계 | MLE, DATA | MLE | 재현 가능한 학습 데이터 구성법 |
| 38 | STT 학습·미세조정·디코더 조정 | STT, MLE | STT | STT 모델, 설정, 디코더 시험 결과 |
| 39 | LLM 지시 학습·미세조정·어댑터 실험 | MLE, PDE | MLE | LLM 모델·어댑터와 비교 결과 |
| 40 | 화자 인식·TTS 모델 조정 | MLE, STT, UX | MLE | 화자 임계값, 음성 모델, 발음·속도 기준 |
| 41 | 실험 조건·초기값·난수값·결과 이력 관리 | MLE | MLE | 실험 관리 대장과 재현 절차 |
| 42 | 양자화·ONNX/QNN/Genie 변환과 자원 최적화 | MLE, ODA | ODA | 변환 모델, 호환성표, 지연·메모리·전력 결과 |
| 43 | 모델 설명서·제약·알려진 실패·재학습 조건 관리 | MLE, QA | MLE | 모델 설명서와 재학습 판단 기준 |
현재 저장소에서는 SenseVoice·화자·TTS 모델 산출물, 로컬 프롬프트, 사전과 평가 도구를 확인할 수 있다. 학습 작업과 공통 실험·모델 관리 시스템의 실제 소유 조직은 별도로 확정해야 한다.
7. 모델·제품 평가
모델 정확도와 실제 제품 동작을 같은 기준으로 검증한다. 자동 지표만으로 종료하지 않고 기기 API 실행, TTS, 지연, 자원, 장시간 복구와 사람 검수를 연결해 출시 가능 여부를 판정한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 지표·산출물·완료 기준 |
|---|---|---|---|---|
| 44 | STT 환경별 디코더·발화 끝점 종합 평가 | STT, QA | STT | WER/CER, 누락, 오수락·거부, 지연 |
| 45 | 사전 매칭 정확도와 충돌 평가 | PDE, QA | PDE | 정탐률, 오탐률, 기능 간 충돌 목록 |
| 46 | LLM Case 분류와 재질의 흐름 평가 | PDE, CLD, QA | QA | Case 정확도, rewrite_query 재진입 성공률 |
| 47 | 토큰·입력값·기기 API·TTS 종단 간 평가 | ODA, DVI, QA | QA | 실행 성공률, 상태·오류·사용자 응답 일치 |
| 48 | 사실성·근거성·환각·안전 약속 평가 | CLD, QA | PO | 근거성, 잘못된 실행 약속, 위험 응답 결과 |
| 49 | 프롬프트·모델 비교와 자동·사람 판정 | PDE, MLE, QA | QA | 비교 승자, 신뢰도, 사람 재검수 기록 |
| 50 | 한국어·영어·말레이시아 등 지역별 평가 | PDE, QA | PO | 언어·지역별 통과율과 예외 목록 |
| 51 | 지연·토큰·메모리·전력·장시간 복구 평가 | ODA, CLD, QA | REL | p50/p95, 호출 비용, 자원, 충돌·누수·복구 결과 |
| 52 | 후보 모델·제품 출시 승인 | QA, PO, REL | PO | 출시 기준 충족 보고서와 승인·보류 사유 |
Prompt Auto Evaluation은 A/B 응답과 자동 판정 결과를 저장하는 도구 이름이므로
원문을 유지한다. 자동 판정은 제품 정답, 실기기 실행 결과와 사람 검수를 대체하지
않고 함께 사용한다.
8. 클라우드·프롬프트·검색 증강
클라우드 LLM이 어떤 입력과 근거를 받고 어떤 형식으로 답할지 관리한다. 프롬프트, 검색 증강(RAG), 인증·복구, 호출 비용과 변경 영향까지 하나의 서비스 운영 범위로 본다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 53 | 시스템 프롬프트·Case 정책·응답 형식 설계 | PDE, CLD | PDE | 프롬프트와 응답 규격 |
| 54 | 기능별 예시·반례·경계 프롬프트 관리 | PDE | PDE | 기능별 예시 묶음과 회귀 시험 |
| 55 | 원문·가공문 출처와 재질의 호환성 관리 | ODA, PDE, CLD | PDE | 입력 추적 계약과 rewrite_query 호환 시험 |
| 56 | 파일·웹 검색 자료의 수집·분할·최신성 관리 | CLD, DATA | CLD | 자료 목록, 색인 버전, 출처·최신성 정책 |
| 57 | 제품·국가·고객 문맥의 근거 범위 관리 | CLD, PDE | PO | 허용 문맥과 근거 경계 |
| 58 | 인증·호출 제한·시간 초과·재시도·대체 응답 관리 | CLD, ODA | CLD | 회복력 정책과 오류 응답 규격 |
| 59 | 토큰·캐시·모델 등급·비용·지연 최적화 | CLD, REL | CLD | 호출량·비용·지연 기준과 최적화 결과 |
| 60 | 클라우드 모델·프롬프트 변경 영향과 되돌리기 관리 | CLD, QA, REL | REL | 변경 보고서, 단계 배포·되돌리기 기준 |
9. 배포·모델 운영
검증된 모델, 프롬프트, 사전과 앱을 재현 가능한 조합으로 배포하고 운영한다. 여기서 모델 운영은 일반적으로 MLOps라고 부르는 모델·데이터·배포 이력 관리 범위를 뜻한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 61 | 모델·프롬프트·사전·데이터 버전 관리 | REL, MLE, PDE, DATA | REL | 통합 버전 관리 대장 |
| 62 | 소스·산출물 해시·설정·출처 연결 관리 | REL | REL | 배포 명세, 구성 목록, 변경 추적 |
| 63 | 모델·사전·Android 앱 호환 묶음과 패키징 검증 | REL, ODA, MLE | ODA | 호환성표, APK 내용·버전·DB 검증 |
| 64 | 배포본·플랫폼 서명과 인증서 검증 | REL, SEC | SEC | 서명 인증서, 해시, 배포 파일 증거 |
| 65 | 개발·통합·SQE·시범·운영 단계 배포 | REL, QA, CLD, ODA | REL | 단계 배포 계획, 그림자 비교·소규모 선행 배포 결과 |
| 66 | 품질·지연·비용·오류·품질 변화 관찰과 재평가 | OPS, QA, MLE, REL | QA | 운영 지표판, 이상 감지와 재평가 조건 |
| 67 | 앱·모델·프롬프트·사전 되돌리기와 사용 종료 | REL, QA, SEC, PO | PO | 되돌리기 훈련, 폐기·보존 기록 |
10. QA·운영·유지보수
개발이 끝난 기능을 시험하고 출시 후 문제를 재현·분석·관리한다. 한 증상에 대해 STT, LLM, 기기 API, TTS와 Android 실행 상태를 같은 추적으로 연결하는 것이 핵심이다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 68 | 평가·회귀·홀드아웃 정답셋 관리 | QA, DATA | QA | 버전이 고정된 정답셋과 변경 사유 |
| 69 | 기능별 정상·오류·상태·충돌 회귀 시험 | QA, PDE, ODA, DVI | QA | 기능 회귀표와 자동·실기기 결과 |
| 70 | SQE 출시 범위·기기·언어·차단 결함 합의 | QA, PO | PO | 인수·예외 승인표와 출시 판정 |
| 71 | 현장 이슈 재현과 STT→LLM→API→TTS 상관 분석 | QA, OPS, ODA | QA | 공통 추적 ID 기반 원인 분석서 |
| 72 | 충돌·무응답·메모리 종료·네이티브 오류 분석 | ODA, OPS | ODA | crash·ANR·LMKD·tombstone 근거와 수정 확인 |
| 73 | 저전력·비상·이동·네트워크 상태 회귀 | QA, DVI | DVI | 상태별 오류·복구 시나리오 결과 |
| 74 | 국가·고객·B2B 현지 운영과 의견 반영 | OPS, PO, QA | PO | 지역 이슈 목록과 반영 결과 |
| 75 | 배포 기록·운영 절차·품질지표 정기 갱신 | OPS, REL, QA, MLE | PO | 릴리즈 노트, 운영 절차서, 정기 품질 검토 |
11. 보안·개인정보·거버넌스
음성·문장·사용자 정보와 모델 운영 과정의 보안 기준을 관리한다. 키 보관, 개인정보, 외부 자료의 권리, AI 응답과 기기 실행 권한, 변경 감사는 다른 개발 업무에 포함시키지 않고 독립 승인 대상으로 유지한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 76 | API 비밀키·플랫폼 서명키의 저장·회전·폐기 | SEC, CLD, REL | SEC | 비밀정보 목록, 회전 기록, 개발용 서명 차단 증거 |
| 77 | 음성·전사문·화자 정보 동의와 로그 개인정보 통제 | SEC, DATA, OPS | SEC | 동의·마스킹·접근·보존 정책과 감사 결과 |
| 78 | 모델·데이터·검색 자료·외부 구성요소 라이선스 관리 | SEC, DATA, MLE, REL | SEC | 라이선스·공급망 구성 목록 |
| 79 | 프롬프트 공격·검색 오염·위험 응답·민감 실행 권한 검증 | SEC, CLD, QA, ODA | SEC | 공격 시험, 안전 정책, 사용자 확인 기준 |
| 80 | 모델·프롬프트·사전·정답지 변경 감사 | REL, QA, SEC | SEC | 변경자·사유·승인·산출물이 연결된 감사 기록 |
12. 파트너 개념검증(PoC)·해외 적용
외부 기술을 도입할지, 내부 기술로 대체할지, 해외 제품에 어떤 구조로 적용할지를 검증하는 업무다. PoC는 시연 성공만으로 끝내지 않고 기존 기준선과의 비교, 제품 통합, 운영 비용, 개인정보, 사업 가치와 종료 판단까지 포함한다.
| 순번 | 업무 | 수행 책임 | 최종 책임 | 산출물·완료 기준 |
|---|---|---|---|---|
| 81 | 파트너 PoC 목표·기준선·도입 판단 공통 관리 | PO, MLE, ODA, QA | PO | 가설, 비교 기준선, 평가표, 도입·보류·종료 사유 |
| 82 | 에너자이 Whisper STT PoC 검증 | STT, MLE, QA | STT | 동일 데이터 기준 정확도·지연·자원·비용 비교와 내부 개발 대비 판단 |
| 83 | Memori Labs 메모리 기술 비교·통합 PoC | MLE, ODA, DATA, SEC | PO | 대안 모듈 비교, 기억 저장·회수 품질, 개인화·지연·비용·개인정보 결과 |
| 84 | Databricks 음성 데이터 활용 PoC | DATA, CLD, PO, SEC | PO | 수집·정제·분석 흐름, 활용 시나리오, 데이터 거버넌스와 사업 가치 검증 |
| 85 | 말레이시아 언어·제품 범위와 하이브리드 구조 설계 | PO, STT, ODA, CLD | PO | 현지 STT→LLM→TTS 흐름, 온디바이스·클라우드 분담, 응답 시간 기준 |
| 86 | 말레이시아 계정·키·RAG·프롬프트 라우팅 구축 | CLD, PDE, DATA, SEC | CLD | 국가별 과금·쿼터, 현지 문서셋, 기능 실행과 근거 답변의 경계 |
| 87 | 말레이시아 현지 검증·운영 이관 | QA, OPS, PO, CLD | PO | 현지 표현 회귀셋, 품질 지표판, 피드백 절차, 운영 책임 이관 기준 |
PoC 공통 판정 질문
- 현재 내부 기준선보다 품질·지연·비용·운영성 중 무엇이 실제로 개선되는가?
- 데모가 아니라 앱·클라우드·기기 실행 경로에 통합 가능한가?
- 데이터 반출, 개인정보, 라이선스와 장기 운영 비용을 감당할 수 있는가?
- 도입, 추가 검증, 내부 개발, 종료 중 어느 결론을 어떤 근거로 내리는가?
13. 업무군 요약
| 도메인 | 업무 수 | 주요 범위 |
|---|---|---|
| 제품·기능 개발 생애주기 | 7 | 요구·지원 범위·입력·UX·종료·변경 정책 |
| 온디바이스 에이전트 핵심 실행부 | 13 | 음성 세션·STT·로컬/클라우드 LLM·기기 API·TTS·Android 생애주기 |
| 기기 기능군 유지보수 | 8 | 청정·이동·설정·환경·화면·스케줄·보안·오류 |
| 데이터 생애주기 | 6 | 수집·비식별·교정·라벨·분할·버전 |
| 모델 개발·학습 | 9 | 기준선·학습·조정·변환·최적화·모델 설명서 |
| 모델·제품 평가 | 9 | STT·LLM·종단 간 동작·안전·성능·출시 승인 |
| 클라우드·프롬프트·검색 증강 | 8 | 응답 규격·근거 자료·복구·비용·변경 영향 |
| 배포·모델 운영 | 7 | 버전·출처·패키징·서명·단계 배포·관찰·되돌리기 |
| QA·운영·유지보수 | 8 | 정답셋·회귀·현장 이슈·장애·지역 운영·운영 문서 |
| 보안·개인정보·거버넌스 | 5 | 키·개인정보·라이선스·AI 안전·감사 |
| 파트너 개념검증(PoC)·해외 적용 | 7 | 공통 도입 판단·에너자이·Memori Labs·Databricks·말레이시아 |
| 합계 | 87 |
14. 역할 약어
| 약어 | 역할 | 최종 판정 또는 주요 책임 범위 |
|---|---|---|
| PO | 제품·서비스 책임자 | 지원 범위, 정책, UX, 성과지표, 최종 인수 |
| ODA | 온디바이스 에이전트 개발 | Android 에이전트, 로컬 실행 경로, 생애주기, 통합 |
| STT | 음성·STT 엔지니어 | 오디오 입력, STT 모델·디코더·전처리 |
| MLE | ML·모델 엔지니어 | 데이터 실험, 학습·조정, 변환, 모델 성능 |
| PDE | 프롬프트·사전 엔지니어 | 프롬프트, 사전, 토큰, 재질의 호환성 |
| CLD | 클라우드 LLM·검색 증강 개발 | 클라우드 API, 모델, 검색 근거, 복구, 비용 |
| DVI | DeviceAgent·SoC 개발 | 기기 API, 상태, 오류 코드, 실제 동작 |
| UX | Launcher·TTS·UX | 화면, 자막, TTS, 사용자 피드백 |
| DATA | 데이터·라벨링 | 수집, 정제, 라벨 정책, 데이터셋 관리 |
| QA | QA·SQE | 독립 평가, 회귀, 실기기 인수 시험 |
| REL | 배포·모델 운영 | 산출물 관리, 배포, 관찰, 되돌리기 |
| SEC | 보안·개인정보 | 키, 서명, 동의, 개인정보, 감사 |
| OPS | 운영·문서 | 운영 관찰, 이슈 관리, 운영 절차, 위키 |
수행 책임은 실제 작업을 수행하는 역할이고, 최종 책임은 결과를 승인하거나
보류할 권한이 있는 단일 책임 역할이다.
15. 보강이 필요한 관리 항목
현재 코드와 문서에서 기능 구현 및 평가 자료를 확인했다. 다음 항목은 담당 조직과 관리 도구를 추가로 정리할 필요가 있다.
| 공백 | 영향 | 우선 보강 업무 |
|---|---|---|
| 통합 데이터셋 관리 대장 부재 | 어떤 데이터로 학습·평가했는지 재현하기 어려움 | 33~34 |
| 학습·실험 관리 대장 부재 | 후보 모델 간 조건과 결과 비교가 불안정함 | 41, 43 |
| 모델·프롬프트·사전 버전 관리 분산 | APK와 실제 실행 구성의 조합을 추적하기 어려움 | 61~63 |
| 프롬프트 평가의 Case 2·3 범위 부족 | 재질의와 준비 질문 회귀를 놓칠 수 있음 | 46, 49 |
| 디코더 기반 STT 정기평가 자동화 부족 | 신호 지표만으로 실제 인식 개선을 판단할 위험이 있음 | 44 |
| 배포 후 품질·비용·대체 경로 통합 관찰 부족 | 장기 품질 저하와 비용 증가 발견이 늦음 | 66 |
| 기능별 종료 상태 계약 분산 | 취소·시간 초과·상태 초기화 결함이 반복됨 | 4, 16~19 |
| 실기기 배포 증거 표준화 부족 | 컴파일 성공과 제품 동작 성공을 구분하기 어려움 | 20, 51~52, 63~65 |
| 파트너 PoC 비교·종료 기준 분산 | 시연 성공과 제품 도입 가능성을 혼동할 수 있음 | 81~84 |
| 말레이시아 운영 소유권·현지 지표 분산 | 국내 기준을 그대로 적용하거나 현지 피드백이 누락될 수 있음 | 85~87 |
16. 업무 등록 최소 형식
새 업무는 최소한 아래 내용을 가져야 한다.
순번 / 업무군
사용자 시나리오와 대표 발화
지원·비지원 범위
수행 책임 / 최종 책임 / 협업 역할
입력·출력·상태·오류 계약
모델·프롬프트·사전·기기 API 영향
자동·종단 간·실기기 인수 기준
산출물·버전·소스 변경·검증 근거
배포·관찰·되돌리기 계획
이 형식은 “모델 평가”, “기능 유지보수”, “말레이시아 지원”처럼 범위가 넓은 요청을 실제 수행 가능한 업무 묶음과 책임자로 구체화할 때 사용한다.
17. 근거와 해석 범위
| 근거 | 확인한 업무 표면 |
|---|---|
FunctionCallHandler.kt, 기능별 SK_xx 인덱스 |
기기 기능·상태·TTS·API 통합 유지보수 |
ForegroundService.kt, QaClient, Audio/STT/TTS 코드 |
온디바이스 에이전트 실행부와 생애주기 |
WORK_INSTRUCTION_TEST_POLICY_2026-05-19.md |
기능·사전·계측 시험 동반 정책 |
Prompt Auto Evaluation |
프롬프트·모델 비교, 자동 판정, 결과 산출물 |
| STT·화자·TTS 모델 파일 | 모델 통합·변환·실행 환경 호환성 업무 |
| Git 배포·사전·프롬프트·모델 이력 | 배포·현지화·회귀·긴급 수정 운영 |
| PoC 회의 기록 | 에너자이 STT, Memori Labs 메모리 비교, Databricks 음성 데이터 활용 판단 |
| 말레이시아 운영·RAG·검증 문서 | 현지 언어, 계정·키, 하이브리드 구조, RAG, 현지 시험·이관 업무 |
이 목록은 제품 LLM 조직이 직접 수행하거나 다른 조직과 책임을 나눠야 하는 업무를 포함한다. 모델 학습 코드가 앱 저장소에 없더라도 모델 학습·데이터·평가 책임은 별도 업무로 관리한다.