CSV · TSV → CSV

Czyszczenie CSV i naprawa importu

Wyczyść pliki CSV lub TSV przed importem prywatnie w przeglądarce.

01

Dodaj plik CSV

CSV · TSV · TXT

02

Ustawienia importu

Wyczyść dane

03

Kolumny

Wybierz i uporządkuj kolumny. Edytuj nazwy, jeśli pierwszy wiersz zawiera nagłówki.

Wybierz plik, aby zobaczyć podgląd.

04

Podgląd

Wybierz plik, aby zobaczyć podgląd.

Pliki pozostają na Twoim urządzeniu.

Oczyść CSV bez utraty znaczenia kolumn

Przygotuj tabelę CSV, TSV lub TXT do importu, poprawiając separatory i kodowanie, usuwając spacje na brzegach pól, puste lub zduplikowane wiersze i uzupełniając krótkie wiersze. Następnie wybierz kolumny, zmień ich nazwy i kolejność. Sprawdź wynik względem reguł importu miejsca docelowego: schludny podgląd nie potwierdza, że identyfikatory, daty lub formuły będą poprawnie interpretowane przez inną aplikację.

Krok po kroku

  1. Otwórz jeden plik i sprawdź jego separator oraz kodowanie znaków. Jeśli wszystkie wartości są w jednej kolumnie, wybierz właściwy separator; jeśli nazwy ze znakami diakrytycznymi są uszkodzone, wybierz kodowanie źródłowe. Zdecyduj, czy pierwszy wiersz jest nagłówkiem.
  2. Włącz tylko potrzebne operacje czyszczenia. Usuwanie spacji odbywa się przed porównywaniem duplikatów, a uzupełnianie może wyrównać krótkie wiersze. Wybierz zachowywane kolumny, zmień nazwy nagłówków i ustaw kolejność strzałkami. Zmiana separatora lub kodowania resetuje wybór kolumn.
  3. Wybierz separator wyjściowy, pobierz oczyszczony CSV i sprawdź go w docelowym importerze. Podgląd pokazuje tylko pierwsze 12 wierszy danych i 12 kolumn; eksport używa wszystkich zachowanych wierszy i wybranych kolumn.

Ustawienia i ograniczenia

Parsowanie i czyszczenie
Automatyczne wykrywanie separatora uwzględnia przecinek, średnik, tabulator i pionową kreskę; własny separator musi być jednym poprawnym znakiem. Obsługiwane są separatory w cudzysłowach, pola wielowierszowe i podwojone cudzysłowy. Nagłówek jest chroniony przed usuwaniem wierszy.
Limity przed czyszczeniem
Limit wejściowy wynosi 20 MiB, 100,000 przeanalizowanych wierszy razem z nagłówkiem, 1,000 kolumn i 1,000,000 komórek. Limity są sprawdzane przed czyszczeniem, więc usuwanie duplikatów nie może uratować odrzuconego już zbyt dużego pliku.
Eksport i typy danych
Wynik jest w UTF-8 bez BOM, z końcami wierszy CRLF i końcowym znakiem nowego wiersza. Nazwa pliku kończy się na -cleaned.csv nawet dla wyjścia rozdzielanego tabulatorami. Pola pozostają tekstem w pliku, ale program importujący decyduje o typach; wartości przypominające formuły nie są neutralizowane.

Przykład z omówieniem

Pobierz dirty-accounts.csv. Wybierz średnik i zachowaj nagłówek. Włącz usuwanie spacji, pustych wierszy i duplikatów oraz uzupełnianie krótkich wierszy. Zmień ID na Account ID, przenieś Name na początek, a następnie wyeksportuj z przecinkiem jako separatorem wyjściowym.

Pobierz pliki przykładowe

Przykładowe dane wejściowe

ID;Name;Note
00123; Anna ;"first; order"
00123;Anna;"first; order"
;;
00456;Bjørn
Oczekiwany wynik
NameAccount IDNote
Anna00123first; order
Bjørn00456

Oczekiwane są dwa usunięte wiersze i brak wierszy o nierównej długości. Dwa wiersze z imieniem Anna stają się identyczne po usunięciu spacji; pusty wiersz znika, a brakująca wartość Note w wierszu z imieniem Bjørn staje się pustym polem. Porównaj cleaned-accounts.csv i tabelę wyjściową. Plik zachowuje 00123 i 00456, ale bezpośrednie otwarcie w Excelu nadal może usunąć zera na początku; importuj te kolumny jako tekst.

Pytania i rozwiązywanie problemów

Dlaczego wykluczenie kolumny nie usunęło więcej duplikatów?

Porównywanie duplikatów używa pełnych oczyszczonych wierszy źródłowych przed wykluczeniem kolumn. Wiersze różniące się tylko w wykluczonej kolumnie pozostają odrębne. Określ zamierzoną regułę duplikatów w źródle przed użyciem narzędzia.

Dlaczego cudzysłowy zmieniły się w eksporcie?

Eksporter odtwarza cudzysłowy dla wybranego separatora i podwaja cudzysłowy wewnątrz pól. Zmiana ze średnika na przecinek może spowodować, że wcześniej cytowane pole nie będzie ujęte w cudzysłowy. Może to zachować tę samą wartość, choć plik nie jest identyczny bajt po bajcie.

Co zrobić z błędami parsowania lub nierównymi wierszami?

Najpierw sprawdź separator i kodowanie. Napraw niedomknięte cudzysłowy w źródle; uzupełnianie dodaje tylko brakujące komórki na końcu i nie naprawi błędnych cudzysłowów ani przesuniętych kolumn. Zachowaj co najmniej jedną zaznaczoną kolumnę i podziel źródło przekraczające limity wejściowe.