y_lab = a_1 x_1 + a_2 x_2 + a_3 x_3 + a_0 데이터 자체가 error 거의 없이 아주 깔끔하게 리니어하게 나오는 실험 결과. 그런데, x_4, x_5를 측정할 수 없는 상황에다 x_1 ~ x_3만 가지고 y를 예측해 볼 수 없는가 하는 상황입니다. x_4랑 x_5가 implicit하게 영향을 주는 y값을 얻어 보니 (y_real이라 하죠) linear하긴 마찬가지, 기울기와 절편이 x_3까지만 세 개 썼을 때와 다를 뿐. 그런데, reproducibility는 얼마나 좋을지 모르는 이 때 y_lab, x_1 ~ x_3만 측정한 데이터만 가지고 y_real을 최대한 가깝게 예측하려면, 팁 좀 부탁해요. 데이터 포인트는 200개 정도, 그런데 이게 샘플 종류별로 합친 거라 종류별로는 약 40~60개 정도(즉, 샘플 종류가 한 4~5종). 굳이 y_real은 얻는 데 너무 오래 걸리고 x_4, x_5는 전혀 확보 못함요, 그렇다고 y_lab을 굳이 더 모을 필요는 없어 보이는 게 linear regression 결과가 꽤 괜찮으므로요.
데이터분석
이런 경우 경험 공유 부탁드려요
21년 04월 22일 | 조회수 338
불
불합리
댓글 1개
공감순
최신순
글
글로리아
21년 05월 29일
확률변수가 아닌 함수관계라면 그럴수도 있겠죠? 에러텀 없으면 굳이 회귀추정식으로 갈 필요 없이 말씀하신 유의미한 영향변수들로 그냥 방정식 세워버리면 되겠네요.
확률변수가 아닌 함수관계라면 그럴수도 있겠죠? 에러텀 없으면 굳이 회귀추정식으로 갈 필요 없이 말씀하신 유의미한 영향변수들로 그냥 방정식 세워버리면 되겠네요.
답글 쓰기
0
지금 바로 리멤버 회원이 되어
모든 댓글을 확인하세요
모든 댓글을 확인하세요
리
리멤버
@멘션된 회사에서 재직했었음
19년 05월 28일
회사에서 풀지 못한 고민, 여기서
회사에서 업무를 하다가 풀지 못한 실무적인 어려움, 사업적인 도움이 필요한 적이 있으셨나요? <리멤버 커뮤니티>는 회원님과 같은 일을 하는 사람들과 이러한 고민을 해결할 수 있는 온라인 공간입니다.
회원 가입 하고 보다 쉽게 같은 일 하는 사람들과 소통하세요
회사에서 풀지 못한 고민, 여기서
회사에서 업무를 하다가 풀지 못한 실무적인 어려움, 사업적인 도움이 필요한 적이 있으셨나요? <리멤버 커뮤니티>는 회원님과 같은 일을 하는 사람들과 이러한 고민을 해결할 수 있는 온라인 공간입니다.
회원 가입 하고 보다 쉽게 같은 일 하는 사람들과 소통하세요
답글 쓰기
0
리
리멤버
@멘션된 회사에서 재직했었음
19년 05월 28일
일하는 사람과 기회를 연결하여 성공으로 이끈다
일하는 사람과 기회를 연결하여 성공으로 이끈다
답글 쓰기
0
추천글