메뉴

국가 데이터 최신성: 출처와 취득일 관리

국가 데이터가 언제 어디서 왔는지 남기지 않으면 비교가 불가능해집니다. 출처 등급, 취득일, 갱신 주기를 관리하는 방법을 정리합니다.

게시일

  • 출처 관리
  • 갱신 주기

국가 데이터 최신성은 값의 정확함보다 먼저 관리해야 할 문제입니다. 값이 맞는지 판단하려면 그 값이 언제 어디서 왔는지를 알아야 하기 때문입니다. 출처와 시점을 남기지 않으면, 두 목록이 어긋날 때 어느 쪽을 믿을지 정할 근거가 사라집니다.

출처를 왜 값마다 남겨야 하나요?

출처는 값에 대한 신뢰도의 근거입니다. 같은 항목이라도 공식 기관 자료에서 온 값과 어느 문서에서 옮겨 온 값은 무게가 다릅니다. 값만 남기고 출처를 지우면, 나중에 그 값의 무게를 알 방법이 없습니다.

또 하나는 충돌 해결입니다. 두 목록이 다른 값을 들고 있을 때, 어느 쪽이 더 최신인지 또는 더 권위 있는지 판단해야 합니다. 출처와 취득일이 있으면 이 판단을 기록으로 남길 수 있고, 없으면 담당자의 기억에 의존하게 됩니다.

출처는 문서 단위로만 남기지 말고 값 단위로 남기는 편이 좋습니다. 한 문서에서 온 값이라도 문서 안의 항목마다 기준 시점이 다를 수 있고, 갱신되는 주기도 다릅니다.

출처에는 어떤 등급을 매기나요?

등급은 서열을 만들기 위한 것이 아니라, 다툼이 생겼을 때의 우선순위를 정해 두기 위한 것입니다. 보통 세 단계로 충분합니다.

  • 1차: 해당 제도를 운영하는 기관이 직접 공표한 자료입니다. 범위와 시점이 명확합니다.
  • 2차: 1차 자료를 정리해 옮긴 자료입니다. 편리하지만 옮기는 과정에서 시점이 밀립니다.
  • 3차: 여러 출처를 모아 만든 목록입니다. 넓게 덮지만 개별 값의 근거가 흐려집니다.

이 등급은 값의 정확함을 보장하지 않습니다. 대신 어느 출처를 먼저 볼지에 대한 규칙을 제공합니다. 등급이 다르고 값이 다르면 높은 등급을 따르고, 그 결정을 기록으로 남깁니다.

등급 성격 강점 약점
1차 기관 직접 공표 시점과 범위가 분명 항목이 좁음
2차 정리해 옮긴 자료 읽기 편함 시점이 밀림
3차 모아 만든 목록 범위가 넓음 근거가 흐림

취득일과 기준 시점은 어떻게 다른가요?

취득일은 우리가 그 값을 가져온 날이고, 기준 시점은 그 값이 세상에서 유효했던 시점입니다. 둘은 다르고, 다를 수 있는 폭도 큽니다. 오래전에 만들어진 문서를 오늘 가져오면 취득일은 오늘이지만 기준 시점은 몇 해 전입니다.

이 둘을 한 칸에 담으면 최신성 판단이 뒤집힙니다. 취득일만 보면 방금 갱신된 자료처럼 보이지만, 실제 값은 오래된 것일 수 있습니다. 그래서 두 날짜를 각각 남기고, 어느 쪽을 기준으로 갱신을 판단할지도 정해 둡니다.

기준 시점이 적혀 있지 않은 자료도 많습니다. 이럴 때는 비워 두지 말고 알 수 없음을 명시합니다. 빈칸은 나중에 누군가 오늘 날짜로 채우고, 그러면 값의 나이가 조용히 사라집니다.

취득일을 남길 때는 가져온 방법도 함께 적습니다. 사람이 옮겨 적은 값과 자동으로 내려받은 값은 오류가 생기는 자리가 다릅니다. 이 정보가 있으면 문제가 생겼을 때 어디부터 확인할지가 정해집니다.

갱신 주기는 무엇으로 정하나요?

갱신 주기는 값이 얼마나 자주 바뀌는지와, 우리가 틀린 값을 얼마나 오래 견딜 수 있는지 가운데 더 짧은 쪽으로 정합니다. 제도가 자주 바뀌는 항목은 짧게, 거의 바뀌지 않는 항목은 길게 잡습니다.

여기에 갱신 비용을 함께 봅니다. 사람이 확인해야 하는 항목은 자동으로 다시 받아오는 항목보다 주기를 길게 잡을 수밖에 없습니다. 대신 주기가 긴 항목은 언제 확인했는지가 화면에 드러나야 합니다.

주기를 한 번 정하고 끝내지 않는 것도 중요합니다. 값이 예상보다 자주 바뀌면 주기를 줄이고, 몇 번을 확인해도 그대로라면 늘립니다. 이 조정 자체를 기록으로 남기면 다음 사람이 같은 시행착오를 반복하지 않습니다.

오래된 값은 언제 버리나요?

버리는 기준도 미리 정해 두는 편이 좋습니다. 기준 없이 두면 오래된 값이 계속 남아 목록을 부풀리고, 새 값과 섞여 어느 쪽이 유효한지 알 수 없게 됩니다.

보통은 세 가지 중 하나로 처리합니다. 기준 시점이 너무 오래된 값은 후보에서 빼고, 남겨야 하는 값은 오래되었음을 표시하고, 확실하지 않은 값은 비워 둡니다. 비워 두는 선택을 두려워할 필요는 없습니다. 틀린 값을 채워 두는 것보다 빈칸이 정직합니다.

값을 버릴 때는 왜 버렸는지도 함께 남깁니다. 이 기록이 없으면 몇 달 뒤 누군가 같은 값을 다시 가져와 같은 문제를 반복합니다.

한 가지 더 정해 둘 것이 있습니다. 어떤 항목을 다시 확인할지 고르는 순서입니다. 주문이 자주 일어나는 국가의 값이 먼저이고, 그다음이 마지막 확인에서 오래 지난 항목입니다. 이 순서를 정해 두면 시간이 부족할 때 무엇을 먼저 볼지 고민하지 않게 됩니다.

같은 값을 두 곳에서 관리하는 상황도 흔합니다. 이때는 어느 쪽이 원본인지 정해 두어야 합니다. 원본이 정해지지 않으면 두 목록이 서로를 덮어쓰고, 어느 값이 마지막으로 확인된 것인지 아무도 말할 수 없게 됩니다. 사본에는 원본의 시점을 함께 적어 두면 대조 작업이 훨씬 쉬워집니다.

개발자를 위한 메모: 출처와 날짜를 데이터로 다뤄라

  • 출처와 취득일, 기준 시점을 각각 별도 항목으로 저장합니다. 한 줄 설명에 섞어 적으면 집계할 수 없습니다.
  • 출처를 사람이 읽는 문장이 아니라 식별자로 둡니다. 같은 기관의 이름 표기가 바뀌어도 과거 값이 끊기지 않아야 합니다.
  • 값마다 신뢰 등급을 함께 저장하고, 충돌 시 우선순위를 코드가 아니라 데이터로 정합니다.
  • 기준 시점을 알 수 없는 경우를 별도 값으로 둡니다. 빈칸과 모름은 다릅니다.
  • 갱신한 내용은 덮어쓰지 말고 이력을 남깁니다. 언제 무엇이 왜 바뀌었는지가 있어야 보고서의 숫자를 설명할 수 있습니다.

다음 단계

지금 목록에서 값을 하나 골라 출처와 취득일, 기준 시점을 적어 보세요. 세 칸 중 채울 수 없는 칸이 있다면 그 목록은 아직 최신성을 판단할 수 없는 상태입니다. 커버리지 상태를 함께 관리하는 방법은 국가 데이터 커버리지 목록에서 이어지고, 목록을 넓힐 때 같은 원칙을 적용하는 방법은 국가 전반의 테스트 데이터 확장에서 다룹니다. 값 자체를 확인할 때는 국가와 지역 디렉터리를 기준으로 삼습니다.

여기 적힌 출처 이름과 날짜는 관리 방법을 설명하려고 만든 합성 예시이며, 어떤 기관의 실제 공표 일정이나 실제 자료 목록이 아닙니다.

이어 읽기

국가별 주소 및 신원 데이터 형식 관련 글